머신러닝 4편

확률과 통계 — 베이즈 정리와 가우시안 분포

suhyun·2026년 9월 13일·읽는 데 약 21분
한 줄로: 확률은 불확실성을 숫자로 바꾸는 도구다. 그 도구의 중심에 베이즈 정리가 있고, 학습이란 사전에서 사후로 가는 일이다.

1. 상자 두 개와 과일

직관이 통하는 문제부터 시작합니다. 빨간 상자에는 사과 2개와 오렌지 5개, 파란 상자에는 사과 3개와 오렌지 2개가 있습니다. 빨간 상자를 고를 확률이 0.3, 파란 상자를 고를 확률이 0.7입니다. 사과를 뽑을 확률은 얼마일까요.

길이 두 갈래입니다. 빨간 상자로 가서 사과를 뽑는 길은 0.3 × 2/7, 파란 상자로 가서 사과를 뽑는 길은 0.7 × 3/5입니다. 상자를 고를 확률과 그 상자 안에서 사과일 확률을 곱하고, 두 길을 더하면 약 0.51입니다. 곱하고 더한 것이 전부이고, 이 계산을 뒤에서 곱 규칙과 합 규칙이라는 이름으로 다시 만납니다.

빨간 상자에서 이미 사과 하나를 꺼냈다면 남은 6개 중 사과는 1개라, 다음에 사과를 뽑을 확률은 2/7이 아니라 1/6입니다. 파란 상자에서 오렌지를 먼저 꺼냈다면 남은 4개 중 사과가 3개라 3/4이 됩니다. 한 번 꺼낸 것이 다음 확률을 바꿉니다.

꺼낸 과일을 도로 넣으면 상자가 처음 상태로 돌아가고, 두 번째 뽑기의 확률이 첫 번째와 똑같습니다. 이때 두 번의 뽑기가 서로 독립이고, 매번 같은 분포를 따른다고 말합니다. 이 둘을 합쳐 iid라고 부릅니다.

iid는 머신러닝에서 거의 항상 가정하는 조건입니다. 그런데 가정이니 확인해야 합니다. 시간에 따라 성질이 변하는 데이터라면 뒤쪽 표본이 앞쪽과 다른 분포에서 나옵니다. 앞사람의 답이 뒷사람에게 영향을 주는 설문도 독립이 깨집니다. iid가 아닌 데이터에 iid를 가정한 알고리즘을 쓰면 결과가 어긋납니다.

2. 직관이 뒤집히는 예 — 심프슨의 역설

신장결석을 치료하는 두 방법을 비교한 자료입니다.

방법 A방법 B
작은 결석93% (87명)87% (270명)
큰 결석73% (263명)69% (80명)
전체78%83%

작은 결석에서도 A가 이기고 큰 결석에서도 A가 이겼는데, 전체를 합치면 뒤집힙니다. 퍼센트만 보면 이유를 알 수 없고 환자 수를 봐야 합니다. 큰 결석은 어느 방법으로 치료해도 성공률이 낮은데, A에게 큰 결석 환자가 몰려 있어 전체 평균이 끌려 내려갑니다. B는 반대로 쉬운 환자가 많아 전체 평균이 올라갑니다. 퍼센트에 속고 개수를 놓친 것입니다.

같은 일이 야구 타율에서도 일어납니다. 두 선수의 타율을 1995년과 1996년으로 나누면 두 해 모두 두 번째 선수가 높은데, 두 해를 합치면 첫 번째 선수가 0.310, 두 번째 선수가 0.270으로 뒤집힙니다. 이것을 심프슨의 역설이라고 부릅니다. 나눠 보느냐 합쳐 보느냐로 결론이 정반대가 됩니다.

표 한 장에서도 눈으로는 틀립니다. 그래서 무엇을 무엇으로 나눠야 하는지, 언제 합쳐도 되는지를 정해 주는 규칙이 필요합니다. 그 규칙의 이름이 확률입니다. 확률은 사건 하나에 붙이는 숫자로, 무작위로 골랐을 때 그 사건이 얼마나 잘 일어나는지를 나타냅니다.

3. 왜 머신러닝은 확률을 쓰나

불확실성은 세 곳에서 옵니다. 첫째는 시스템 자체입니다. 같은 조건을 줘도 결과가 매번 조금씩 다릅니다. 둘째는 측정입니다. 센서에는 잡음이, 사람이 붙인 라벨에는 실수가 섞입니다. 셋째는 모델입니다. 우리가 쓰는 모델이 현실을 완전히 담지 못합니다. 확률은 이 셋을 숫자로 바꿔 놓는 도구입니다.

불확실성을 없애는 게 늘 좋은 것도 아닙니다. 아기는 사랑스럽다, 이 한 문장이면 대부분 맞습니다. 정확하게 말하려면 졸릴 때와 배고플 때만 빼고, 아플 때, 기저귀가 젖었을 때를 계속 붙여야 하고 끝이 없습니다. 그래서 예외를 다 적는 대신 숫자 하나를 붙입니다. 아기가 사랑스러울 확률이 0.9입니다. 규칙을 전부 적을 수 있는 경우에도 복잡하고 확실한 모델보다 단순하고 불확실한 모델이 나을 때가 많습니다. 전달이 쉽고 다루기도 쉽기 때문입니다.

확률과 통계

확률은 분포를 알고 있을 때 사건의 확률을 계산합니다. 주사위가 공평하다는 것을 알고 어떤 눈이 나올지를 따지는 쪽입니다. 통계는 반대로, 던진 결과만 있고 분포를 모를 때 그 데이터로 분포를 알아냅니다. 머신러닝은 데이터에서 출발하니 통계 쪽에 서 있습니다.

분포의 모양을 정하는 숫자 몇 개를 파라미터라고 부릅니다. 가우시안 분포는 평균과 분산 두 개면 모양이 완전히 정해집니다. 모르는 이 값을 데이터로 추정하는 일이 통계입니다. 표본의 평균과 분산을 계산해서 분포의 평균과 분산을 맞히는 식입니다.

4. 확률변수와 분포 함수

확률변수는 무작위로 일어나는 현상의 결과를 숫자로 옮긴 것입니다. 동전의 앞면과 뒷면은 숫자가 아니지만, 뒷면을 0, 앞면을 1로 정하면 숫자가 됩니다. 그래서 확률변수는 변수이면서 동시에 결과들을 숫자로 보내는 함수입니다.

주사위 눈처럼 값이 띄엄띄엄하면 이산, 키처럼 170과 171 사이에 무한히 많은 값이 있으면 연속입니다. 둘은 확률을 적는 방식이 다릅니다.

  • 확률질량함수 — 이산일 때 값마다 확률을 하나씩 적은 표입니다. 주사위라면 여섯 칸에 각각 1/6. 모든 값이 0 이상이고 전부 더하면 정확히 1이어야 합니다.
  • 확률밀도함수 — 연속이면 키가 정확히 170센티미터일 확률은 0입니다. 그래서 169에서 171 사이일 확률처럼 구간으로 묻고, 곡선 아래 넓이가 확률입니다. 곡선이 0 아래로 내려가지 않고 전체 넓이가 1이어야 합니다.
  • 누적분포함수 — 어떤 값 이하일 확률을 모아 놓은 함수입니다. 0에서 시작해 1이 되고, 올라가기만 합니다. 밀도를 왼쪽부터 적분한 것이 누적분포이고, 누적분포를 미분한 것이 밀도입니다.

분명히 할 것이 하나 있습니다. 밀도함수의 높이는 확률이 아닙니다. 넓이가 확률입니다. 폭이 아주 좁은 구간에 값이 몰려 있으면 높이가 3이나 10이 되기도 하지만, 폭이 좁으니 넓이는 여전히 1입니다.

5. 분포를 요약하는 숫자들

기댓값

값에 그 값이 나올 확률을 곱해서 전부 더한 것입니다. 주사위라면 1부터 6까지 각각에 1/6을 곱해 더하니, 21을 6으로 나눈 3.5입니다. 눈금에 3.5는 없지만 그것이 기댓값입니다.

이 계산은 확률을 알아야 하는데 실제로는 모릅니다. 그래서 100번 던져 나온 눈을 더하고 100으로 나눕니다. 이것이 표본평균이고, 횟수를 늘릴수록 기댓값에 가까워집니다. 기댓값은 손에 넣을 수 없는 이상적인 값이고 표본평균은 실제로 계산할 수 있는 값입니다. 머신러닝에서 손실의 평균을 내는 것이 전부 이 계산입니다.

기댓값은 선형입니다. 두 함수를 더한 것의 기댓값은 각각의 기댓값의 합이고, 상수를 곱하면 그 상수는 밖으로 빠져나옵니다. 복잡한 식의 기댓값을 조각으로 쪼개 따로 구할 수 있어서, 뒤에 나오는 거의 모든 유도가 이 성질을 씁니다.

분산, 공분산, 상관계수

분산은 각 값에서 평균을 빼고 제곱해서 평균을 낸 것입니다. 그냥 빼면 플러스와 마이너스가 상쇄돼 0이 되기 때문에 제곱합니다. 주사위라면 평균 3.5에서 1은 2.5 떨어져 제곱하면 6.25이고, 여섯 칸을 전부 구해 평균을 내면 약 2.92입니다. 제곱근을 씌운 값이 표준편차입니다.

변수가 둘이면 한쪽이 커질 때 다른 쪽도 커지느냐를 묻게 됩니다. 분산의 식은 같은 변수를 두 번 곱한 모양인데, 그중 하나를 다른 변수로 바꾸면 공분산입니다. 각 변수에서 자기 평균을 빼고 둘을 곱해서 평균을 냅니다. 변수가 벡터면 이 값들이 모여 공분산 행렬이 됩니다.

공분산은 단위에 딸려 다닙니다. 키를 센티미터로 재느냐 미터로 재느냐에 따라 값이 통째로 달라집니다. 그래서 두 표준편차의 곱으로 나눈 상관계수를 씁니다. 항상 −1과 1 사이이고, 1에 가까우면 같이 커지고 −1에 가까우면 반대로 움직이며 0이면 직선 관계가 없습니다. 산점도에서 점들이 둥글게 퍼져 있으면 0에 가깝고, 오른쪽 위로 길게 늘어서면 크고, 오른쪽 아래로 늘어서면 음의 상관입니다.

모멘트

평균과 분산은 모멘트라는 같은 가족입니다. 1차가 평균(위치), 2차가 분산(퍼진 정도), 3차가 왜도(한쪽으로 치우친 정도), 4차가 첨도(봉우리가 뾰족한 정도)입니다. 실제로 쓰는 것은 4차까지이고, 모멘트는 결국 분포의 모양을 기술하는 값들입니다.

6. 결합·주변·조건부 확률과 독립

공 100개가 색(빨강, 파랑)과 크기(크다, 작다)를 가집니다. 빨강·큼 20개, 빨강·작음 30개, 파랑·큼 10개, 파랑·작음 40개입니다.

  • 결합확률 — 빨강이면서 클 확률: 20/100 = 0.2
  • 주변확률 — 크기는 보지 않고 빨강일 확률: (20 + 30)/100 = 0.5
  • 조건부확률 — 빨강인 것을 알 때 클 확률: 20/50 = 0.4

같은 20을 무엇으로 나누느냐가 세 확률을 가릅니다. 이 셋을 잇는 규칙이 둘입니다. 합 규칙은 다른 변수로 전부 더하면 주변확률이 나온다는 것이고, 방금 빨강 행을 더한 것이 그것입니다. 곱 규칙은 결합확률이 조건부확률 곱하기 주변확률이라는 것입니다. 0.4 × 0.5 = 0.2로 결합확률과 같습니다. 맨 앞의 과일 문제에서 쓴 계산이 바로 이 둘이었습니다.

독립과 조건부 독립

빨강이라는 것을 알아도 클 확률이 변하지 않으면, 즉 조건부확률이 그냥 확률과 같으면 두 변수가 독립입니다. 곱 규칙에 넣으면 결합확률이 두 확률의 곱이 됩니다. 선형대수의 일차독립과는 아무 관계가 없습니다. 확률적 독립은 한쪽을 알아도 다른 쪽에 대해 아무것도 알게 되지 않는다는 뜻입니다.

원래는 얽혀 있는데 세 번째 변수를 알고 나면 얽힘이 풀리는 경우가 조건부 독립입니다. 아이스크림 판매량과 물놀이 사고 건수는 같이 오르내리지만, 기온을 알고 나면 둘 사이의 관계가 사라집니다. 그림 모형과 나이브 베이즈가 이 개념 위에 서 있습니다.

독립과 무상관은 다르다

독립이면 공분산이 0이지만, 거꾸로는 성립하지 않습니다. 점들이 원 위에 고르게 놓여 있으면 공분산은 0인데, 가로 좌표를 알면 세로 좌표가 두 값 중 하나로 좁혀집니다. 상관은 2차 모멘트까지만 보기 때문입니다. 직선으로 늘어선 관계는 잡아내지만 원이나 곡선 같은 관계는 놓칩니다. 공분산이 0이라는 말은 직선 관계가 없다는 말이지, 관계가 없다는 말이 아닙니다.

연쇄 법칙과 언어 모델

곱 규칙을 변수 여러 개로 늘리면 연쇄 법칙입니다. 첫 변수의 확률, 곱하기 첫 변수가 주어졌을 때 둘째 변수의 확률, 곱하기 앞의 둘이 주어졌을 때 셋째 변수의 확률입니다. 어느 변수부터 시작해도 되지만, 앞에서 꺼낸 변수들은 그다음 항의 조건에 전부 들어가야 합니다. 문장 하나의 확률을 이렇게 쓰면 마지막 단어는 앞의 모든 단어를 조건으로 받습니다. 지금 쓰이는 언어 모델이 계산하는 것이 이 식입니다.

7. 베이즈 정리

곱 규칙을 두 방향으로 씁니다. 결합확률은 P(B|A)·P(A)이고, 뒤집으면 P(A|B)·P(B)입니다. 두 식은 같은 값이니 등호로 놓고 정리하면 한쪽 조건부확률이 다른 쪽으로 바뀝니다. 이것이 베이즈 정리입니다. 새 개념이 아니라 곱 규칙 두 번입니다.

A를 파라미터, B를 데이터라고 놓으면 뒤집는 것이 왜 대단한지 보입니다. 알고 싶은 것은 데이터를 봤을 때 파라미터가 무엇이냐인데, 이건 직접 구하기 어렵습니다. 반대로 파라미터를 가정하면 그 데이터가 나올 확률은 계산할 수 있습니다. 베이즈 정리가 쉬운 쪽에서 어려운 쪽으로 건너가게 해 줍니다.

데이터를 보기 전의 파라미터 확률이 사전확률, 파라미터를 가정했을 때 데이터가 나올 확률이 가능도, 데이터를 보고 난 뒤의 파라미터 확률이 사후확률입니다. 사후확률은 가능도 곱하기 사전확률에 비례합니다.

이 식은 믿음이 바뀌는 과정을 그대로 적은 것입니다. 지구가 평평하다고 100퍼센트 확신하는 사람은 어떤 자료를 봐도 생각이 바뀌지 않습니다. 사전확률이 1이면 사후확률도 1이기 때문입니다. 확신이 90퍼센트라면 자료를 볼 때마다 80, 70으로 내려가고 언젠가 생각을 바꿉니다. 학습이란 사전에서 사후로 확신을 갱신하는 일이고, 데이터가 들어오는 자리가 가능도입니다. 가능도가 큰 파라미터 쪽으로 믿음이 옮겨 가고, 데이터를 더 볼수록 사후확률이 한쪽으로 모입니다.

8. 유방암 검사 예제

40세 미만에서 유방암에 걸릴 확률이 1퍼센트입니다. 암이 있을 때 검사가 양성으로 나올 확률이 75퍼센트이고, 암이 없는데도 양성이 나올 확률이 10퍼센트입니다. 검사에서 양성이 나왔습니다. 실제로 암일 확률은 얼마일까요. 75퍼센트 근처일 것 같습니다.

  • 분자, 암이면서 양성: 0.75 × 0.01 = 0.0075
  • 암이 아닌데 양성: 0.1 × 0.99 = 0.099
  • 분모, 양성이 나오는 모든 경우: 0.0075 + 0.099 = 0.1065
  • 0.0075 ÷ 0.1065 ≈ 0.07

75퍼센트가 아니라 7퍼센트입니다. 암인 사람이 원래 100명 중 1명뿐이기 때문입니다. 암이 아닌 99명 중 10퍼센트, 약 10명이 양성으로 나오고, 암인 1명 중 양성은 0.75명입니다. 양성 판정을 받은 사람을 모으면 대부분이 암이 아닌 쪽입니다. 그래서 드문 병은 검사가 아주 정확하지 않은 한 무작정 검사하지 않는 편이 낫습니다.

분모는 암인 경우와 아닌 경우를 전부 훑어서 더한 값입니다. 이것을 주변화라고 부르고, 합 규칙을 그대로 쓴 것입니다. 파라미터가 연속이면 더하기가 파라미터 공간 전체에 대한 적분이 되는데, 대부분의 문제에서 이 적분은 계산이 안 됩니다. 머신러닝에서 가장 골치 아픈 항이 이것입니다.

베이지안과 빈도주의

베이지안은 파라미터를 확률변수로 보고, 사전분포를 놓고 데이터로 갱신합니다. 관측된 데이터는 고정된 사실입니다. 빈도주의는 파라미터를 고정된 하나의 값으로 보고 사전분포를 쓰지 않으며, 데이터를 무작위 표본으로 봅니다. 표본이 충분히 쌓이면 참값에 수렴한다고 봅니다.

진단은 베이지안에 가깝습니다. 환자를 다시 100번 아프게 할 수는 없으니 눈앞의 환자 한 명에 대해 확신을 갱신해야 합니다. 동전이나 주사위는 같은 조건으로 얼마든지 반복할 수 있어 빈도주의에 가깝습니다. 베이지안은 사후확률을 보고 빈도주의는 가능도를 봅니다. 머신러닝은 베이지안 쪽 도구를 많이 씁니다.

9. 가우시안 분포

정규분포라고도 부르는 가우시안은 가운데가 높고 양쪽으로 대칭으로 내려오는 종 모양입니다. 봉우리의 위치가 평균, 퍼진 정도가 분산입니다. 평균을 바꾸면 종이 옆으로 움직이고, 분산을 키우면 낮고 넓게 퍼집니다. 넓이는 항상 1이라 넓어지면 반드시 낮아집니다. 양쪽 끝은 0처럼 보이지만 0이 아닙니다.

가우시안을 편애하는 이유가 세 가지 있습니다.

  1. 충분통계량 — 평균과 분산 두 값이면 분포가 완전히 정해지고, 표본평균과 표본분산이 그대로 추정값이 됩니다. 데이터가 백만 개여도 두 숫자만 남기고 원본을 버려도 손해가 없습니다.
  2. 켤레 — 가우시안 두 개를 곱해도, 독립인 가우시안 두 개를 더해도 가우시안입니다. 사전분포와 가능도가 가우시안이면 사후분포도 가우시안이 됩니다. 사전과 사후가 같은 집안인 이 관계를 켤레라고 부르고, 켤레이면 그 골치 아픈 적분 없이 평균과 분산만 새로 구하면 끝납니다.
  3. 중심극한정리 — 주사위 한 번의 분포는 평평합니다. 두 개를 더하면 2가 되는 경우는 한 가지, 7이 되는 경우는 여섯 가지라 삼각형 모양이 됩니다. 다섯 개를 더하면 종 모양에 아주 가깝습니다. 독립인 확률변수를 여러 개 더하면 원래 분포가 무엇이든 합이 가우시안에 가까워집니다.

측정 잡음은 온도, 진동, 회로의 흔들림 같은 수많은 작은 원인이 더해진 결과입니다. 하나하나의 분포는 몰라도 더해진 결과는 가우시안에 가까워집니다. 그래서 잡음과 오차를 가우시안으로 모델링하는 것은 근거 없는 가정이 아니라 정리에서 나온 결론입니다.

다변량 가우시안과 마할라노비스 거리

변수가 여러 개면 평균은 벡터, 분산은 공분산 행렬이 됩니다. 대각선에는 각 변수의 분산, 대각선 밖에는 변수 쌍의 공분산이 들어갑니다. 종 모양이 언덕이 되고, 같은 높이를 이은 등고선은 타원입니다.

등고선이 타원인 이유는 지수 안의 값이 공분산의 역행렬을 끼운 거리, 마할라노비스 거리이기 때문입니다. 공분산 행렬이 단위행렬이면 유클리드 거리가 됩니다. 많이 퍼진 방향으로는 조금 떨어진 것으로, 적게 퍼진 방향으로는 많이 떨어진 것으로 칩니다. 가로 표준편차가 10, 세로가 1일 때 중심에서 가로로 10 떨어진 점과 세로로 1 떨어진 점은 유클리드 거리로는 열 배 차이지만 마할라노비스 거리로는 둘 다 1입니다.

무상관이라고 독립은 아니라고 했지만 예외가 있습니다. 두 변수가 가우시안이면 무상관일 때 독립입니다. 공분산 행렬의 대각선 밖이 전부 0이면 밀도함수가 변수별 곱으로 쪼개지기 때문입니다.

10. 선형변환과 화이트닝

가우시안에 행렬을 곱해도 가우시안입니다. 평균은 원래 평균에 그 행렬을 곱한 값이 됩니다. 기댓값이 선형이라 상수 행렬이 밖으로 빠져나오기 때문입니다. 공분산은 행렬, 원래 공분산, 행렬의 전치를 차례로 곱한 값이 됩니다. 타원이 늘어나고 기울어집니다.

반대로 타원을 원으로 펴는 변환이 화이트닝입니다. 세 가지를 구분해야 합니다.

  • 표준화 — 각 축의 분산만 1로 맞춥니다. 축이 기울어 있으면 상관은 그대로 남습니다.
  • 무상관화 — 축을 돌려 기울기를 없앱니다. 분산은 축마다 다릅니다.
  • 화이트닝 — 둘 다 합니다. 공분산 행렬이 단위행렬이 되고 등고선이 원이 됩니다.

축을 돌리는 데 공분산 행렬의 고유값 분해를 씁니다. 고유벡터가 새 축의 방향, 고유값이 그 축으로 퍼진 정도입니다. 고유벡터로 축을 돌린 다음 고유값의 제곱근으로 각 축을 나누면 원이 됩니다. 과제 1번에서 손글씨 데이터로 구한 그 분해와 같은 계산입니다.

변수를 바꾸면 밀도도 바뀐다

이것은 모든 분포에 해당합니다. x가 0과 1 사이에 고르게 퍼져 있으면 밀도는 1입니다. y = 10x로 놓으면 y는 0과 10 사이에 고르게 퍼지고, 폭이 10배가 됐으니 넓이를 1로 유지하려면 밀도는 0.1이어야 합니다. 일반적으로 새 밀도는 원래 밀도를 부피 변화량으로 나눈 값입니다. 변수 하나면 기울기이고, 여러 개면 야코비 행렬의 행렬식입니다. 선형변환이라면 그 행렬의 행렬식이 곧 부피 변화량이고, 화이트닝에서 공분산이 단위행렬이 되는 것도 이 규칙을 따른 결과입니다.

11. 가우시안의 한계와 다른 분포들

첫째 한계는 파라미터 수입니다. 변수가 100개면 평균 벡터에 100개, 공분산 행렬은 대칭이라 절반만 세도 5050개로, 합치면 5천 개가 넘습니다. 데이터가 그만큼 없으면 추정할 수 없으니 가정을 넣어 줄입니다. 대각선만 쓰면(변수 사이에 상관이 없다고 보면) 전부 200개가 됩니다. 대각선 값이 전부 같다고 보면 공분산 쪽은 숫자 하나가 되어 101개로 줄고, 등고선이 완전한 원이 됩니다. 이것을 등방성이라고 부르고, 표현력을 그만큼 잃습니다.

둘째 한계가 더 근본적입니다. 가우시안은 봉우리가 하나뿐입니다. 어려운 시험의 점수 분포는 개념을 이해한 학생은 대부분 맞히고 이해하지 못한 학생은 대부분 틀려서, 높은 쪽과 낮은 쪽에 덩어리가 하나씩 생기고 가운데는 비어 있습니다. 여기에 가우시안 하나를 맞추면 봉우리 사이의 빈 곳에 중심이 놓여, 아무도 없는 자리가 가장 그럴듯한 자리가 됩니다. 덩어리 하나에 가우시안 하나씩 두고 가중치를 붙여 더하면 됩니다. 이것이 혼합 가우시안이고 뒤에 군집화에서 다시 만납니다.

정상성

시간이 지나도 분포가 변하지 않으면 그 과정을 정상이라고 부릅니다. 엄밀하게는 왜도와 첨도까지 같아야 하지만 보통은 평균과 분산만 확인합니다. 어제의 데이터와 오늘의 데이터가 같은 통에서 나왔느냐는 질문입니다. 앞구간으로 학습하고 뒷구간으로 시험하는 것은 두 구간의 분포가 같다는 가정 위에서만 말이 됩니다. 신호의 평균이 시간에 따라 계속 올라가면 앞구간에서 배운 평균이 뒷구간에서는 전혀 다르고, 모델이 맞지 않습니다. 시계열 데이터에서 반드시 확인해야 하는 가정입니다.

나머지 분포들

  • 균등분포 — 구간 안에서 전부 같은 확률입니다.
  • 베르누이 — 동전 한 번. 앞면일 확률 p, 뒷면 1 − p, 기댓값 p입니다.
  • 이항분포 — 그 동전을 n번 던져 m번 앞면일 확률. 기댓값은 np입니다.
  • 카테고리컬 — 결과가 셋 이상일 때. 클래스가 10개면 정답 자리만 1인 길이 10 벡터로 답을 적고, 모델은 자리마다의 확률을 내놓으며 전부 더하면 1입니다. 이미지 분류에서 아주 많이 씁니다.
  • 다항분포 — 카테고리컬을 여러 번 반복해 각 결과가 나온 횟수를 셉니다. 베르누이와 이항의 관계가 한 칸씩 올라간 것입니다.
  • 라플라스는 가우시안보다 봉우리가 뾰족하고, 베타디리클레는 확률 자체에 대한 사전분포로 쓰입니다.

정리

확률은 불확실성을 숫자로 바꾸는 도구이고, 그 중심에 베이즈 정리가 있습니다. 확률변수와 분포로 대상을 정의하고, 기댓값과 분산으로 요약하고, 합 규칙과 곱 규칙으로 이었습니다. 그 위에 베이즈 정리가 서고, 가우시안이 재료가 됩니다. 처음의 심프슨 역설로 돌아가면, 나눠 볼지 합쳐 볼지를 정해 주는 것이 조건부확률이었습니다. 다음 진도는 정보이론입니다.

dev-news학습 노트소개개인정보 처리