머신러닝 6편

과제 2번 확률 연습문제 — 기댓값의 선형성 하나로 푸는 여섯 문제

suhyun·2026년 9월 20일·읽는 데 약 11분
한 줄로: 여섯 문제가 전부 기댓값의 선형성 하나에서 갈라져 나온다. 답을 외우는 것이 아니라, 채점자가 보는 자리를 알고 스스로 쓰는 것이 목표다.

1. 여섯 문제, 한 줄기

풀 문제는 교재 1장 연습문제 1.5, 1.6, 1.9, 1.10, 1.11, 1.13 여섯 개입니다. 흩어져 보이지만 전부 기댓값이라는 도구 하나에서 갈라져 나옵니다. 먼저 그 도구를 손에 쥐고, 그다음 문제를 번호순으로 엽니다. 뒤 문제가 앞 문제의 결과를 그대로 가져다 쓰기 때문에 앞을 건너뛰면 뒤가 막힙니다. 숫자 예시는 하나로 갑니다. 데이터 세 개, 2와 4와 6입니다. 이 세 숫자가 마지막 문제까지 따라옵니다.

2. 기댓값, 선형성, 분산

관측되는 값 하나를 x라고 부릅니다. x는 확률에 따라 이 값이 되기도 하고 저 값이 되기도 하니 확률변수입니다. 기댓값 E[x]는 값마다 확률을 곱해서 더한 것입니다. x가 2, 4, 6 중 하나이고 확률이 각각 1/3이면 기댓값은 12를 3으로 나눈 4입니다. 확률이 모두 같으면 기댓값은 산술평균과 같습니다.

x에 어떤 계산을 씌운 것을 f라고 씁니다. 예를 들어 x를 제곱하는 계산입니다. x가 흔들리면 f도 흔들리니 f도 확률변수이고 기댓값을 가집니다. x가 2, 4, 6이면 f는 4, 16, 36이고 기댓값은 56/3입니다.

선형성

기댓값은 더하기와 상수 곱하기를 그냥 통과시킵니다. 이것이 선형성입니다.

  • 합의 기댓값은 기댓값의 합입니다.
  • 상수는 기댓값 기호 밖으로 나옵니다. 상수 하나만 있으면 그 기댓값은 상수 자신입니다. 3은 확률 1로 나오니 3의 기댓값은 3입니다.

여섯 문제에서 실제로 쓰는 도구는 거의 이것 하나이고, 나머지는 제곱을 펼치는 계산입니다.

분산

분산은 값들이 평균에서 얼마나 떨어져 있는지를 숫자 하나로 잰 것입니다. 값에서 평균을 뺀 다음 제곱하고, 그 제곱의 기댓값을 취합니다. 그냥 빼서 더하면 위아래로 상쇄되어 항상 0이 되니 제곱으로 부호를 없앱니다. 2, 4, 6이면 평균이 4이므로 차이는 −2, 0, 2, 제곱하면 4, 0, 4, 평균 내면 8/3입니다. 분산의 양의 제곱근이 표준편차입니다.

3. 문제 1.5 — 분산의 두 표현

분산의 두 표현 E[(x − E[x])²]E[x²] − E[x]²가 같다는 것을 보이는 문제입니다. 순서만 다른 것처럼 보이지만 완전히 다른 계산입니다. 숫자로 먼저 확인하면, 제곱의 기댓값은 56/3, 기댓값의 제곱은 4² = 16이고, 56/3 − 16 = 8/3입니다. 정의로 구한 값과 같습니다.

기호로 증명할 때는 평균을 μ로 줄여 씁니다. 중요한 점은 μ가 x에 따라 변하지 않는 상수라는 것입니다. 괄호를 펼치면 세 항이 나오고, 여기에 기댓값을 씌워 선형성으로 항마다 떼어 냅니다. 가운데 항에서 2와 μ는 상수라서 밖으로 나오고, 마지막 항은 상수의 기댓값이라 그대로입니다. 남은 것을 정리하면 두 번째 표현이 됩니다.

채점자가 보는 줄

절반이 깎이는 자리는 상수를 밖으로 뺀 줄에 근거를 적지 않는 경우입니다. 근거는 두 문장입니다. μ가 상수여서 기댓값 밖으로 나온다. 상수의 기댓값은 그 상수 자신이다. 이 두 줄이 없으면 계산이 전부 맞아도 근거 없는 전개로 처리됩니다. 답안에서 가장 흔하게 비는 자리입니다.

4. 문제 1.6 — 독립이면 공분산은 0

용어 세 개가 필요합니다.

  • 결합 확률 — 변수 두 개가 각각 어떤 값일 확률을 하나로 적은 것입니다.
  • 독립 — 한쪽 값을 알아도 다른 쪽에 대해 아무것도 알 수 없는 상태입니다. 독립이면 결합 확률이 각각의 확률의 곱으로 쪼개집니다.
  • 공분산 — 두 변수가 같이 움직이는 정도입니다. 각각에서 자기 평균을 뺀 다음 곱하고 기댓값을 취합니다. 같이 커지면 양수, 반대로 움직이면 음수입니다.

정의의 괄호 두 개를 곱하면 네 항이 나오고, 기댓값을 씌워 선형성으로 정리하면 곱의 기댓값에서 기댓값의 곱을 뺀 형태 E[xy] − E[x]E[y]가 남습니다. 이제 독립을 씁니다. 값이 연속이면 기댓값은 적분으로 계산하는데, 결합 확률이 곱으로 쪼개지므로 이중적분이 적분 두 개의 곱으로 갈라집니다. 그러면 곱의 기댓값이 기댓값의 곱과 같아지고, 차이는 0입니다.

5. 문제 1.9 — 가우시안의 꼭대기

다음 세 문제의 무대는 가우시안 분포입니다. 종 모양 곡선이고, 모양을 정하는 숫자는 중심인 평균과 퍼진 정도인 분산 두 개입니다. 식에는 지수함수가 있고 지수 자리에 제곱이 들어 있어서, 그대로 미분하면 계산이 지저분해집니다. 그래서 로그를 먼저 취합니다. 로그는 단조증가 함수라 최댓값의 위치가 바뀌지 않습니다. 위치만 궁금할 때는 로그를 취해도 손해가 없습니다.

가우시안이 가장 높아지는 지점, 최빈값을 찾는 문제입니다. 로그를 취하면 항이 두 개입니다. 첫째 항에는 x가 없어 미분하면 사라집니다. 둘째 항은 x에서 평균을 뺀 것을 제곱하고 마이너스를 붙인 꼴입니다. x로 미분해서 0으로 두면 x는 평균과 같습니다. 종 모양의 꼭대기가 한가운데라는 예상과 맞습니다.

최대인지 밝힌다

미분해서 0이 되는 점은 꼭대기일 수도 골짜기일 수도 있습니다. 그래서 한 번 더 미분합니다. 결과는 −1/분산입니다. 분산은 항상 양수이므로 이 값은 어디서나 음수이고, 곡선이 위로 볼록하다는 뜻입니다. 위로 볼록한 곡선에서 기울기가 0인 점은 유일한 꼭대기입니다. 이 확인 줄을 빼면 왜 최대인지가 비어 채점에서 깎입니다.

변수가 여러 개일 때

뒷부분은 x가 숫자 여러 개를 묶은 벡터인 경우입니다. 분산 자리에는 변수끼리의 공분산을 표로 적은 공분산 행렬이, 나눗셈 자리에는 그 역행렬이 들어갑니다. 로그를 취하면 x가 들어 있는 항은 하나뿐이고, 그 항을 x로 미분합니다.

0으로 두면 역행렬 곱하기 (x − 평균)이 0이라는 식이 됩니다. 여기서 바로 x가 평균이라고 쓰면 깎입니다. 곱해서 0이 되는 경우는 둘 중 하나가 0인 경우이니, 역행렬이 0을 만들지 않는다는 근거가 필요합니다. 공분산 행렬은 양의 정부호이고, 따라서 역행렬이 정칙입니다. 정칙이란 곱해서 0이 되게 만드는 상대가 0뿐이라는 뜻입니다. 이 한 줄이 있어야 결론이 유일해집니다. 마지막으로 헤시안이 음의 정부호임을 적어 최대임을 밝힙니다.

6. 문제 1.10 — 독립인 두 변수의 합

평균은 합의 기댓값이 기댓값의 합이라는 선형성 그대로이고 한 줄로 끝납니다. 덧붙이면 좋은 것이 있습니다. 독립이라는 조건은 평균 쪽에서는 쓰이지 않았다는 점입니다. 선형성은 독립이든 아니든 항상 성립합니다. 조건을 어디에 썼고 어디에 쓰지 않았는지 밝히는 것이 완결성 점수입니다.

분산에서는 1.5와 1.6이 동시에 쓰입니다. 1.5의 결과를 x + z라는 하나의 변수에 적용해 제곱의 기댓값에서 기댓값의 제곱을 뺍니다. 괄호를 펼치면 x의 분산, z의 분산, 그리고 두 배의 교차항이 나옵니다. 그 교차항이 정확히 공분산의 정의이고, 1.6에서 독립이면 공분산이 0이라고 이미 보였으니 교차항이 사라집니다. 독립 조건은 여기에서 쓰입니다.

7. 우도와 로그우도

남은 두 문제는 방향이 반대입니다. 지금까지는 분포를 알고 값을 따졌는데, 이제는 값이 주어져 있고 분포를 모릅니다. 데이터 2, 4, 6을 보고 이 데이터를 만든 가우시안의 평균과 분산을 되찾아야 합니다.

도구는 우도입니다. 어떤 평균과 분산을 가정했을 때 이 데이터가 나올 확률이고, 데이터가 독립이면 각각의 확률을 전부 곱한 것입니다. 곱한 형태는 미분하기 어려우니 로그를 취해 합으로 바꿉니다. 로그우도는 항이 셋입니다.

  1. 데이터에서 평균을 뺀 것의 제곱을 전부 더해 분산으로 나누고 마이너스를 붙인 항 — 평균과 분산이 둘 다 들어 있습니다.
  2. 분산에 로그를 씌운 것에 데이터 개수를 곱한 항 — 분산만 들어 있습니다.
  3. 상수 — 어느 쪽으로 미분하든 사라집니다.

어느 항에 무엇이 들어 있는지 먼저 보면 미분이 훨씬 쉬워집니다.

8. 문제 1.11 — 최대우도로 평균과 분산 구하기

평균

평균이 들어 있는 항은 첫째 항뿐입니다. 연쇄법칙으로 미분하면 제곱을 내려 2가 앞으로 나오고, 안쪽을 평균으로 미분하면 −1이 나옵니다. 두 부호가 만나 전체가 양수가 됩니다. 0으로 두고 양변에 분산을 곱합니다. 분산이 양수라서 곱해도 방향이 바뀌지 않습니다. 정리하면 추정값은 데이터의 산술평균, 2와 4와 6이면 4입니다.

분산으로 미분할 때의 함정

이 과제에서 가장 많이 틀리는 자리입니다. 표준편차로 미분하면 안 됩니다. 분산을 통째로 하나의 변수로 두고 미분합니다. 헷갈리면 분산에 s라는 새 이름을 붙입니다. 그러면 첫째 항은 1/s 꼴, 둘째 항은 log s 꼴이 됩니다. 1/s를 미분하면 −1/s², log s를 미분하면 1/s입니다. 이 두 공식을 답안에 밝히면 전개가 끊기지 않습니다. 0으로 두고 정리하면 제곱합을 데이터 개수로 나눈 값이 나옵니다.

완결성 한 문장

방금 구한 식에는 평균이 들어 있습니다. 그런데 평균의 추정값은 분산과 상관없이 따로 구해졌습니다. 서로 얽혀 있지 않으니 평균을 먼저 구해서 대입할 수 있습니다. 이 문장이 없으면 왜 대입해도 되는지가 비어서 감점됩니다. 대입하면 분산의 추정값은 각 데이터에서 산술평균을 뺀 제곱의 평균, 2와 4와 6이면 8/3입니다.

9. 문제 1.13 — 불편 추정

참값은 데이터를 만들어 낸 진짜 평균과 진짜 분산입니다. 보통은 참값을 모르고 데이터로 추정하는데, 추정값은 데이터를 새로 뽑으면 다른 값이 나오며 흔들립니다. 그 흔들리는 값의 기댓값이 참값과 정확히 같으면 불편 추정량이라고 부릅니다. 한 번 맞힌다는 뜻이 아니라 평균적으로 맞는다는 뜻입니다.

마지막 문제는 앞의 분산 추정식에서 중심만 바꿉니다. 산술평균 대신 참평균을 안다고 치고 그것을 중심으로 제곱을 잽니다. 이 추정량의 기댓값이 참분산과 같음을 보이라는 것입니다. 기댓값을 취하고 선형성으로 합 안으로 넣으면 항 하나만 따지면 됩니다. 나머지는 같은 모양이기 때문입니다.

항 하나의 제곱을 펼치면 세 덩어리가 나옵니다. 가우시안에서 알려진 두 값을 씁니다. 데이터의 기댓값은 참평균이고, 데이터 제곱의 기댓값은 참평균의 제곱 더하기 참분산입니다. 대입하고 정리하면 참평균이 들어간 항들이 서로 지워지고 참분산만 남습니다. 이 계산에서 중심이 참평균이라는 가정이 쓰인다는 문장을 적어야 합니다. 이 값은 데이터 번호와 무관하므로 개수로 나누면 참분산이 그대로 남습니다.

왜 이 문제를 내는가

2, 4, 6의 산술평균 4를 중심으로 한 제곱합의 평균은 8/3입니다. 참평균이 3이었다고 해 봅시다. 3을 중심으로 재면 제곱은 1, 1, 9이고 평균은 11/3으로 더 큽니다. 우연이 아닙니다. 산술평균은 그 데이터에 대해 제곱합을 가장 작게 만드는 점이기 때문입니다. 그래서 데이터로 구한 중심을 쓰면 분산이 실제보다 작게 나오고, 참값을 중심으로 쓰면 그 치우침이 사라집니다. 이것이 이 문제의 요점입니다.

정리

여섯 문제가 전부 한 줄기였습니다. 기댓값의 선형성으로 항을 떼어 내고, 제곱을 펼치고, 조건을 어디에 썼는지 밝히는 것입니다. 답을 외우지 말고 이 줄기를 따라가면 됩니다.

제출 전에 세 가지를 확인합니다. 답안은 손으로 써야 합니다. 타이핑은 0점입니다. 전부 영어로 써야 합니다. 한국어가 섞이면 0점입니다. 그리고 여기서 짚은 근거 줄들을 빼지 않아야 합니다. 점수가 갈리는 곳이 그 자리들입니다.

dev-news학습 노트소개개인정보 처리