-----------------------------------------------------------------
Week 5: Learning from data: regression
제5주차: 자료에서 정보 얻어내기(회귀/경향성 분석)
- Using machine learning tools to investigate your data
수집한 자료를 조사하기 위해 기계학습 도구(분석 소프트웨어)를 활용하기
- Calculating the red-shifts of distant galaxies
먼 은하의 적색편이 계산하기
-----------------------------------------------------------------
1강: 자료 가지고 학습하기
Lesson 1: Learning from Data / 한글자막
-----------------------------------------------------------------
2강: 우주의 규모, 거리측정
Lesson 2: The Cosmological Distance Scale / 한글자막
-----------------------------------------------------------------
3강: 기계 학습의 기초
Lesson 3: What is machine learning / 한글자막
-----------------------------------------------------------------
4강: 결정 트리 분류기
Lesson 4: Decision Tree Classifier / 한글자막-----------------------------------------------------------------
5강: 회귀 결정 트리로 적색편이 측정
Lesson 5: Estimating Redshifts using Regression / 한글자막 / 영문자막
* 단어에 익숙해지기
- Supervised Learning (교사학습)
- Classification(분류)와 Regression(회귀): 교사학습 알고리즘
- Decision Tree Model (결정 트리 모형): 학습기 구조의 한 형태
- Decision Tree Classifier (결정 트리 분류기)
- Decision Tree Regressor (결정 트리 회귀자)
[00:06] 앞서 장난감 로봇의 예를 가지고 결정 트리 분류(classification)와 회귀(regression)가 어떻게 작동하는지 살펴봤다. 이렇게 배운 지식을 실제 자료에 적용해 볼 때가 됐다. 은하에서 방출되는 전체 빛은 전자기 스펙트럼의 모든 파장에 걸쳐 분포한다. 슬로언 디지털 스카이 서베이는 모든 천체에 대해 파장 구간 300에서 1,100 나노미터에서 5개의 광학 및 1개의 적외선 필터를 사용하여 입사량(flux)을 측정한다. 천체로부터 필터의 파장에 해당하는 빛이 얼마나 많이 방출되는지 알 수 있다. 측정된 입사량은 다시 각 필터에 붙인 이름으로 빛의 세기(등급)로 환산된다.(필터의 빛 통과 특성은 선형적이지 않다)- Decision Tree Regressor (결정 트리 회귀자)
[00:43] 지금 보는 이 그림는 25광년 떨어진 청색의 밝은 주계열 별 베가(Vega)의 스펙트럼이다. 표면온도가 약 1만도 켈빈 가량되는 아주 뜨거운 별이다. (겉보기 색깔은) 가장 밝은 빛의 파장으로 나타났다고 할 수 있다. 이번에는 이 베가가 실제로는 아주 먼 은하에 속한 별이라고 해보자. 우주의 팽창을 말해 주듯이 베가는 적색편이를 보이고 같은 스펙트럼이지만 최고점의 위치가 더 긴 파장 쪽으로 이동하여 망원경에 장착된 여러 파장대역의 필터를 통해 다르게 측정된다.
[01:17] 필터마다 측정치를 계량화 하였는데 이를 색차라 한다. 색차는 이웃한 파장대역의 필터를 통과한 빛의 평탄화한 측정비로 이웃한 필터의 밝기 등급 차와 같다. 슬로언 필터가 다섯개 이므로 4개의 색차가 나온다. 이를테면, u-g, g-r, r-i 그리고 i-z.
[01:35] 스펙트럼이 희미한(퍼진) 빛의 은하라도 기본적으로 그 은하에 속한 모든 별의 빛의 총체다. 측광 적색편이 분류의 요점은 적색편이된 은하가 적색편이가 없을 때와 비하여 다른 관측 색차를 갖게될 것이라는 점이다. 하지만 이 생각에는 근본적인 애매함이 있는데 자료에 근거한 혹은 실증적인 방법 이외에는 문제를 풀 방법이 없다는 것이다. (적색편이는 우주팽창을 의미하는데 이는 관측에 의한 발견이며 규명된 이론은 없다.) 만일 두 은하의 관측된 색차가 다르다면 그것이 적색편이로 인한 것인지 혹은 한 은하의 스펙트럼이 다른 은하와 달리 좀 특이 했던 것인지 누가 알겠는가?
[02:10] 기계학습이 이 의문에 대한 탈출구가 되어줄 것이다. (엄청난 양의 관측자료에 기반한 기계학습이 우주의 수수께끼를 풀 수 있다.) 먼저 은하 5만개 가량의 대규모 관측자료를 가져오자. 이 자료들은 분광학적으로 적색편이가 측정되고 (분광학,spectroscopy 과 측광, photometry는 현재 가장 정밀한 우주 관측방법이다) 네가지 측광 색차가 계산되었다.
[02:24] 그런다음, 특징(이번 예의 경우 색차)를 사상하는 결정 트리 회귀자(regressor)를 훈련 시킨다. ('훈련'은 관측치로부터 추출한 특징인 색차를 입력으로 받아 이를 결정해주는 사상함수 혹은 결정트리, decision tree 를 구축하는 과정이다.) 이번 예의 경우 사상의 결과(함수에서 되돌려지는 값)은 분광학에서 얻은 적색편이다. 여기에 보는 것은 3단계 결정 트리 회귀(decision tree regression)다.
[02:39] 첫째로 자료를 분할하는 결정은 u-g 색차가 0.7475보다 작거나 같을 때다. 그 아랫단계의 분류는 g-r 이 0.372보다 작거나 같을 때다. 결정이 중지되면 그 지점의 회귀 값(regression value, value=1.1859)과 평균 제곱근 오류(mean square error, mse = 0.5109) 값을 돌려준다.
[03:00] (결정 트리)모형에서 결정을 따르기는 쉬운 반면 (모형의) 구성이 매우 복잡하여 전체를 통찰하기는 상당히 어렵다. 예를들어 우리의 실험에서 가장 우수한 성능을 내는 결정 트리는 최대 깊이가 일곱차례의 결정 과정을 거치는 경우다. 그런데 우리 모형이 얼마나 정밀할까? 우리가 사용한 표본에서 모든 은하에 대해 예상(expected)적색편이 대비 실(true)적색편이의 비교를 도표로 나타내 보았다. (분광학 정보를 알고있는 은하를 훈련에 사용하였다. 훈련이 끝난 결정 트리 모형을 검증하기 위해 훈련에 사용한 은하들을 결정트리에 넣어보고 정확도를 확인해본다.) 그림에서 보는 대로 대부분 예상치가 실제 값과 일치했다. 평균자승 오차(Root Mean Square) 분포로 이들 예측의 정확도를 평가 할 수 있다. 물론 소수의 예측이 벗어난 경우도 보인다. 때로 이를 파탄적 예외(catastrophic outliers)라고 부르긴 하는데 결정트리 모형을 심각하게 외곡 시킬 수도 있기 때문이다. 이들 오류의 원인은 잘못된 분광 분류, 색차계산의 오차, 혹은 학습에 사용된 은하가 명확하지 않았던 탓일 수도 있다. 이에 대해 좀더 심도있게 따져 볼 수 있다. 하지만 현재로서 이번 최초 결과에 만족하기로 한다.
[03:54] 이제 (훈련된)결정트리 회귀자를 분광학 자료가 없는 은하를 상대로 실행시켜보자. 실행하기 전에 먼저 훈련해 놓은 모형이 얼마나 잘 작동할지 그 회귀 정확도를 염두에 둬야한다. 각 은하가 괜찮은 적색편이 값을 알려줄 수 있는 경우에 해당하는지 아니면 비극적 예외중 하나가 될지 모르기 때문이다. 이는 분명히 엄청난 문제이긴 하다. 이를 개선할 방법은 다음주 강의에서 살펴보자.
[04:21] 최고의 예측가능한 분류와 예측을 위해 기계학습 알고리즘과 그 문제에 대한 우리의 천문학 전문지식을 결합한다. 일예로, 상당수의 측광 적색편이 분류기들은 애매함을 줄이기 위해 은하 종류별 여러가지 스펙트럼 틀(spectra template)을 가지고 있다.
[04:38] 자, 이제 한발짝 물러서서 우리가 해놓은 것이 어떻게 작동하는지 보자. 단지 네개의 색차 특징과 약간 오차가 있는 미리 분리해서 보관중인 자료를(이번 연구를 위해 특별히 세심하게 마련하지 않은 일반자료를 의미함)사용 했지만 의미있는 정밀도의 적색편이 예측(결정 트리에서 알려준 적색편이 값)을 할 수 있었다. 이에 덧붙여 분류 과정이 개인 컴퓨터에서 단 몇초 만에 빠르게 끝마칠 수 있었다. 인간이 했더라면 수년이 걸렸을 일이다. 기계학습은 대량의 자료 분석에 있어서 극도로 강력한 도구이다.
댓글 없음:
댓글 쓰기