확률변수론 1편

확률의 공리와 베이즈 정리 — 집합에서 조건부확률까지

suhyun·2026년 10월 9일·읽는 데 약 18분
한 줄로: 확률은 사건이라는 집합에 매기는 값이고, 조건을 건다는 것은 그 조건 사건을 새 전체집합으로 삼는다는 뜻입니다.

1. 무작위 실험과 확률 모델

확률은 무작위 실험(random experiment)에 대해 정의합니다. 무작위 실험은 할 때마다 여러 결과 가운데 하나가 나오는 실험입니다. 동전을 던지면 앞면이나 뒷면이 나오고, 주사위를 던지면 1부터 6까지의 눈 가운데 하나가 나옵니다.

무작위의 반대말은 결정론적(deterministic)입니다. 결정론적인 양은 값이 이미 정해져 있습니다. 값이 정해져 있다는 것과 우리가 그 값을 안다는 것은 다른 문제입니다. 어제 서울의 최저 기온은 이미 정해진 값이지만, 기록을 찾아보기 전까지 우리는 그 값을 모릅니다. 모른다고 해서 무작위가 되지는 않습니다.

구분값이 정해져 있나우리가 값을 아나
결정론적, 알려짐예예
결정론적, 모름예아니오
무작위아니오실험해 봐야 나옴

동전 던지기도 물리적으로 따지면 완전한 무작위가 아닙니다. 던진 힘과 회전, 공기 저항, 바닥에 닿는 각도가 정해지면 결과도 정해집니다. 그래도 이 과정은 너무 복잡해서 계산하거나 예측할 수 없으므로, 수학에서는 무작위로 모델링합니다. 앞면 확률을 1/2로 두는 것도 하나의 모델입니다. 동전을 구부려 놓으면 0.48이 더 맞는 모델일 수 있습니다.

확률을 정하는 방법은 여러 가지가 있습니다. 동전을 1000번 던져 앞면이 507번 나왔다면 앞면 확률을 507/1000으로 보는 상대도수(relative frequency) 방식이 있습니다. 이 과목은 공리적 정의(axiomatic definition)를 씁니다. 공리(axiom)는 증명 없이 참으로 받아들이는 가정입니다. 확률에 관한 공리 세 개를 세우고, 나머지 성질은 전부 이 공리에서 증명합니다. 그 공리를 쓰려면 먼저 집합의 언어가 필요합니다.

이렇게 추상적으로 시작하는 이유는 공학의 여러 분야가 같은 도구를 쓰기 때문입니다. 디지털 통신에서는 0을 보냈는데 수신기가 1로 읽을 오류 확률(probability of error)로 시스템 성능을 잽니다. 네트워크에서는 패킷이 언제 도착할지, 처리에 얼마나 걸릴지가 모두 무작위이고, 이것을 다루는 분야가 큐잉 이론(queueing theory)입니다. 레이더는 잡음 섞인 신호가 문턱값(threshold)을 넘으면 표적이 있다고 판정하는데, 문턱값이 너무 높으면 표적을 놓치고 너무 낮으면 잡음을 표적으로 오인합니다. 두 실수의 확률을 계산해야 문턱값을 정할 수 있습니다. 머신러닝 분류기도 이미지가 각 범주에 속할 확률을 계산해 가장 큰 쪽을 고릅니다.

2. 집합의 언어

집합(set)은 원소(element)의 모임입니다. 확률에서는 실험의 결과를 원소로 하는 집합을 다룹니다. 동전을 두 번 던지는 실험이라면 가능한 결과 전체는 다음과 같습니다. 이렇게 가능한 결과를 모두 담은 집합을 전체집합(universal set)이라 하고 U로 씁니다.

U = {HH, HT, TH, TT}

"두 번 모두 같은 면"은 {HH, TT}, "두 번째가 뒷면"은 {HT, TT}입니다. 둘 다 U의 부분집합(subset)입니다. A가 B의 부분집합이면 A ⊂ B로 씁니다. 모든 집합은 자기 자신의 부분집합이고, 원소가 하나도 없는 공집합(empty set) ∅은 모든 집합의 부분집합입니다. A ⊂ B이고 B ⊂ A이면 두 집합은 같습니다.

합집합(union) A ∪ B는 A나 B 가운데 적어도 한쪽에 속하는 원소의 모임이고, 교집합(intersection) A ∩ B는 양쪽에 모두 속하는 원소의 모임입니다. 교집합은 자주 쓰므로 AB로 줄여 쓰기도 합니다. 이 글에서 P(AB)는 P(A ∩ B)와 같습니다.

법칙식
교환법칙A ∪ B = B ∪ A, A ∩ B = B ∩ A
결합법칙(A ∪ B) ∪ C = A ∪ (B ∪ C), 교집합도 같음
분배법칙A ∩ (B ∪ C) = (A ∩ B) ∪ (A ∩ C)

A의 여집합(complement) Ac는 U에서 A에 속하지 않는 원소의 모임입니다. A ∪ Ac = U이고 A ∩ Ac = ∅입니다. 여집합의 여집합은 자기 자신이고, Uc = ∅, ∅c = U입니다. 합집합과 교집합의 여집합은 드모르간 법칙(De Morgan's law)으로 바꿉니다.

(A ∪ B)c = Ac ∩ Bc, (A ∩ B)c = Ac ∪ Bc

"A도 B도 일어나지 않는다"를 계산할 때 이 법칙이 바로 쓰입니다. 그 사건은 (A ∪ B)c이므로 확률은 1 − P(A ∪ B)로 구합니다.

3. 배반과 분할

두 집합 A, B가 A ∩ B = ∅을 만족하면 배반(mutually exclusive)이라고 합니다. 공통 원소가 하나도 없습니다. 집합이 여러 개일 때는 서로 다른 모든 쌍이 배반이어야 합니다.

Ai ∩ Aj = ∅ (모든 i ≠ j)

여러 집합 전체의 교집합 A1 ∩ A2 ∩ ⋯ ∩ An이 공집합이라는 조건만으로는 부족합니다. 이 조건은 배반이기 위한 필요조건일 뿐입니다.

문제 1

주사위 눈의 집합 U = {1, 2, 3, 4, 5, 6}에서 A = {1, 2}, B = {2, 3}, C = {3, 4}로 둡니다. A ∩ B ∩ C는 무엇이고, A, B, C는 배반입니까?

세 집합에 모두 들어 있는 눈은 없으므로 A ∩ B ∩ C = ∅입니다. 그런데 A ∩ B = {2}, B ∩ C = {3}으로 공집합이 아닌 쌍이 있습니다. 그래서 A, B, C는 배반이 아닙니다. 셋의 교집합이 비었다는 사실에서 쌍마다 겹치지 않는다는 결론은 나오지 않습니다.

집합 A1, A2, …, An이 서로 배반이고 합집합이 U이면 이 모임을 U의 분할(partition)이라고 합니다. 합치면 빈틈없이 U가 되고 서로 겹치지 않습니다. 주사위라면 {1, 2}, {3, 4, 5}, {6}이 하나의 분할입니다. 어떤 집합 A와 그 여집합 Ac는 언제나 U의 분할을 이룹니다. 분할은 뒤에서 볼 전확률정리의 바탕이 됩니다.

4. 표본공간과 사건

집합의 용어를 확률의 용어로 옮깁니다. 무작위 실험의 결과 하나하나를 결과(outcome) 또는 표본점(sample point)이라 합니다. 모든 표본점을 모은 집합이 표본공간(sample space)이고, 집합론의 전체집합에 해당합니다. 표본공간의 부분집합을 사건(event)이라고 합니다.

주사위에서 말로 쓴 사건집합
아무 결과도 포함하지 않는 사건∅
6이 나온다{6}
3의 배수가 나온다{3, 6}
4 이하가 나온다{1, 2, 3, 4}
무엇이든 나온다{1, 2, 3, 4, 5, 6} = U

확률은 사건에 매기는 값입니다. P(·)는 함수이고, f(x) = x2의 인자 x가 실수인 것처럼, 확률이라는 함수의 인자는 표본공간의 부분집합입니다. "주사위에서 3의 배수가 나올 확률"은 사건 {3, 6}에 매긴 값 P({3, 6})입니다.

5. 확률의 세 공리와 따라 나오는 성질

확률은 다음 세 공리를 만족하는 함수로 정의합니다.

  1. P(A) ≥ 0 — 음수 확률은 없습니다.
  2. P(U) = 1 — 표본공간은 모든 결과를 담고 있으므로 반드시 일어납니다.
  3. A ∩ B = ∅이면 P(A ∪ B) = P(A) + P(B) — 배반인 사건의 확률은 더합니다.

공리이므로 증명하지 않습니다. 세 공리는 확률값을 어떻게 정할지는 말하지 않습니다. 공정한 주사위라면 눈마다 1/6을 줍니다. 6이 잘 나오도록 만든 주사위라면 P({6}) = 0.25, 나머지 눈마다 0.15를 줄 수도 있습니다. 값이 모두 0 이상이고 합이 5 · 0.15 + 0.25 = 1이므로 이것도 공리를 만족하는 확률입니다. 이 주사위에서 짝수가 나올 확률은 공리 3에 따라 0.15 + 0.15 + 0.25 = 0.55입니다.

아래 성질은 공리가 아니므로 세 공리만으로 증명합니다.

성질식
공집합P(∅) = 0
여사건P(Ac) = 1 − P(A)
합집합P(A ∪ B) = P(A) + P(B) − P(AB)
여러 배반 사건P(A1 ∪ ⋯ ∪ An) = P(A1) + ⋯ + P(An)

공집합. U = U ∪ ∅이고 U와 ∅은 배반입니다. 공리 2와 3에서 1 = P(U) = P(U) + P(∅) = 1 + P(∅)이므로 P(∅) = 0입니다.

여사건. A ∪ Ac = U이고 두 사건은 배반입니다. 그래서 1 = P(A) + P(Ac)이고, 정리하면 P(Ac) = 1 − P(A)입니다.

합집합. A ∪ B를 배반인 두 조각 A와 AcB로 나눕니다. 또 B는 배반인 AB와 AcB로 나뉩니다. 공리 3을 두 번 쓰면 다음과 같습니다.

P(A ∪ B) = P(A) + P(AcB), P(B) = P(AB) + P(AcB)

둘째 식에서 P(AcB) = P(B) − P(AB)를 얻어 첫째 식에 넣으면 성질이 나옵니다. A와 B가 배반이면 P(AB) = 0이 되어 공리 3과 같아집니다. 네 번째 성질은 공리 3을 n개로 반복해 쓴 것입니다.

문제 2

P(A) = 0.6, P(B) = 0.5, P(A ∪ B) = 0.8입니다. P(AB)와 "A도 B도 일어나지 않을" 확률을 구하십시오.

합집합 성질에서 0.8 = 0.6 + 0.5 − P(AB)이므로 P(AB) = 0.3입니다. A도 B도 일어나지 않는 사건은 Ac ∩ Bc이고, 드모르간 법칙으로 (A ∪ B)c와 같습니다. 여사건 성질에서 확률은 1 − 0.8 = 0.2입니다.

6. 조건부확률 — 조건 사건이 새 전체집합이 된다

사건 B가 일어났다고 가정할 때 사건 A의 확률을 조건부확률(conditional probability)이라 하고 P(A | B)로 씁니다.

P(A | B) = P(AB) / P(B), P(B) ≠ 0

식보다 뜻을 먼저 잡아 두면 이후가 쉬워집니다. B가 일어났다고 가정하면 B 밖의 결과는 더 이상 나올 수 없습니다. 그러면 B가 새 전체집합이 됩니다. 그 가정 아래에서 B의 확률은 1이어야 합니다. 조건부확률은 새 전체집합 B 안에서 AB가 차지하는 비율입니다. B 안의 비율은 그대로 두고 B 전체를 1로 키운 것이 P(B)로 나누는 일입니다.

숫자로 봅니다. P(A) = 0.5, P(B) = 0.4, P(AB) = 0.1이라고 합시다. B는 AB 부분 0.1과 B에만 속하는 부분 0.3으로 나뉩니다. 비율은 1 : 3입니다. 이 비율을 유지하며 B 전체를 1로 키우면 AB 부분은 1/4이 됩니다. 정의로 계산해도 P(A | B) = 0.1 / 0.4 = 0.25입니다. 아무 조건이 없을 때 A의 확률은 0.5였는데, B를 알고 나니 0.25로 줄었습니다.

공정한 주사위에서도 해 봅니다. "짝수가 나왔다"는 사실만 들었을 때 4 이상일 확률은 얼마일까요. 새 전체집합은 {2, 4, 6}이고 그 안에서 4 이상인 눈은 {4, 6}입니다. 세 눈의 확률이 같으므로 답은 2/3입니다. 정의로 계산해도 P({4, 6}) / P({2, 4, 6}) = (2/6) / (3/6) = 2/3입니다. 조건이 없을 때 4 이상일 확률 1/2보다 커졌습니다. 짝수 쪽에 큰 눈이 더 많이 들어 있기 때문입니다.

정의의 양변에 P(B)를 곱하면 곱셈 꼴이 됩니다. A와 B의 역할을 바꿔도 같은 식이 성립합니다.

P(AB) = P(A | B) P(B) = P(B | A) P(A)

곱셈 꼴에는 나눗셈이 없으므로 P(B) = 0일 때도 쓸 수 있습니다. 그때는 양변이 모두 0입니다.

7. 연쇄법칙과 나무 그림

곱셈 꼴을 한 번 더 쓰면 사건 셋의 교집합도 차례로 계산할 수 있습니다. 이것을 연쇄법칙(chain rule)이라고 합니다.

P(ABC) = P(A) P(B | A) P(C | AB)

증명은 조건부확률의 정의를 두 번 쓰는 것입니다. P(ABC) = P(C | AB) P(AB)이고, P(AB) = P(B | A) P(A)입니다. 읽는 순서는 먼저 A의 확률, A를 가정한 B의 확률, A와 B를 모두 가정한 C의 확률입니다.

이 계산은 나무 그림(tree diagram)으로 그리면 한눈에 보입니다. 첫 단계에서 A와 Ac로 가지를 나누고, 각 가지에서 다시 B와 Bc로 나눕니다. 가지 위에는 조건부확률을 적습니다. 잎 하나의 확률은 뿌리에서 그 잎까지 가지 값을 모두 곱한 값입니다.

예를 들어 빨간 공 5개와 파란 공 3개가 든 주머니에서 공을 하나씩, 넣지 않고 세 번 꺼낸다고 합시다. 세 번 모두 빨간 공일 확률은 첫 번째가 빨강일 확률 5/8, 첫 번째가 빨강일 때 두 번째도 빨강일 확률 4/7, 앞의 둘이 빨강일 때 세 번째도 빨강일 확률 3/6을 곱한 값입니다.

P(빨강, 빨강, 빨강) = (5/8) · (4/7) · (3/6) = 60/336 = 5/28 ≈ 0.179

8. 전확률정리

A1, A2, …, An이 표본공간의 분할이고 B는 어떤 사건이라고 합시다. B를 분할 조각마다 자르면 A1B, A2B, …, AnB가 됩니다. 분할 조각끼리 겹치지 않으므로 잘린 조각들도 서로 배반이고, 합치면 B입니다. 공리 3과 곱셈 꼴을 쓰면 전확률정리(total probability theorem)가 나옵니다.

P(B) = ∑i P(AiB) = ∑i P(B | Ai) P(Ai)

B의 확률을 바로 구하기 어려울 때, 경우를 나눠 각 경우에서의 조건부확률을 구한 뒤 그 경우가 일어날 확률을 곱해 더합니다. 나무 그림에서는 B로 끝나는 잎의 확률을 모두 더하는 일과 같습니다.

앞 절의 주머니(빨강 5, 파랑 3)에서 두 번째로 꺼낸 공이 빨강일 확률을 구해 봅니다. 첫 번째 공의 색으로 경우를 나눕니다. 첫 공이 빨강(5/8)이면 남은 7개 중 빨강이 4개이고, 첫 공이 파랑(3/8)이면 남은 7개 중 빨강이 5개입니다.

P(두 번째 빨강) = (4/7) · (5/8) + (5/7) · (3/8) = 20/56 + 15/56 = 35/56 = 5/8

첫 번째 공의 색을 모르는 채로 두 번째 공을 보면, 첫 번째 공을 볼 때와 확률이 같습니다. 첫 공을 보지 않았다면 두 번째 자리도 여덟 개 공 가운데 하나가 같은 가능성으로 놓이는 자리이기 때문입니다.

자주 하는 실수는 P(Ai)를 곱하지 않고 P(B | A1) + P(B | A2) + ⋯처럼 조건부확률만 더하는 것입니다. 조건부확률은 서로 다른 전체집합 위에서 잰 비율이므로 그냥 더하면 의미가 없습니다. 각 조건이 일어날 확률로 가중해야 합니다. 이 정리는 뒤에서 확률변수의 분포, 기댓값, 연속형 분할로 모양을 바꿔 계속 나옵니다.

9. 베이즈 정리

전확률정리가 "결과 B가 일어날 확률"을 묻는다면, 베이즈 정리(Bayes' rule)는 반대 방향을 묻습니다. B가 일어났다는 것을 알 때 그 원인이 Ai였을 확률 P(Ai | B)입니다. 문제에는 보통 반대 방향인 P(B | Ai)가 주어집니다. 곱셈 꼴 P(AiB) = P(Ai | B) P(B) = P(B | Ai) P(Ai)를 P(Ai | B)에 대해 풀고, 분모에 전확률정리를 넣으면 됩니다.

P(Ai | B) = P(B | Ai) P(Ai) / ∑j P(B | Aj) P(Aj)

레이더 경보

레이더 한 대를 생각합니다. A는 실제로 비행기가 날고 있는 사건, B는 경보가 울리는 사건입니다. 다음 값이 주어졌습니다.

값뜻
P(A) = 0.02비행기가 실제로 있을 확률
P(B | A) = 0.95탐지 확률(probability of detection). 클수록 좋습니다
P(B | Ac) = 0.05오경보 확률(probability of false alarm). 작을수록 좋습니다

경보가 울렸을 때 비행기가 실제로 있을 확률을 구합니다. 먼저 분할 {A, Ac}에 대한 전확률정리로 경보가 울릴 확률을 구합니다.

P(B) = 0.95 · 0.02 + 0.05 · 0.98 = 0.019 + 0.049 = 0.068

나무 그림의 잎 네 개로 정리하면 다음과 같습니다. 네 값의 합은 1입니다.

첫 가지둘째 가지잎의 확률
비행기 있음 (0.02)경보 (0.95)0.019
비행기 있음 (0.02)경보 없음 (0.05)0.001
비행기 없음 (0.98)경보 (0.05)0.049
비행기 없음 (0.98)경보 없음 (0.95)0.931

경보가 울렸다는 것은 첫째와 셋째 잎 가운데 하나에 있다는 뜻이고, 그 둘이 새 전체집합입니다. 그 안에서 비행기가 있는 잎이 차지하는 비율이 답입니다.

P(A | B) = 0.019 / 0.068 = 19/68 ≈ 0.279

탐지 확률 95%, 오경보 확률 5%인 레이더인데도, 경보가 울렸을 때 비행기가 실제로 있을 확률은 28%가 안 됩니다. 원인은 P(A) = 0.02입니다. 비행기가 없는 시간이 98%나 되므로, 5%라는 작은 오경보 확률이 큰 몫에 곱해져 0.049가 됩니다. 이 값이 실제 탐지에서 나오는 0.019보다 큽니다. 경보만 보고 판단할 때 사전 확률 P(A)를 빼먹으면 이 차이를 놓칩니다. 희귀한 질병의 검사 결과를 해석할 때도 같은 계산이 나옵니다.

문제 3

한 공장에서 기계 1, 2, 3이 전체 생산량의 50%, 30%, 20%를 만듭니다. 각 기계의 불량률은 1%, 2%, 5%입니다. 제품 하나를 무작위로 골랐을 때 (가) 불량일 확률과 (나) 불량이었다면 기계 3에서 나왔을 확률을 구하십시오.

Mi를 "기계 i가 만든 제품", D를 "불량"이라고 둡니다. M1, M2, M3은 표본공간의 분할입니다. (가)는 전확률정리입니다.

P(D) = 0.01 · 0.5 + 0.02 · 0.3 + 0.05 · 0.2 = 0.005 + 0.006 + 0.010 = 0.021

(나)는 베이즈 정리입니다.

P(M3 | D) = 0.010 / 0.021 = 10/21 ≈ 0.476

기계 3은 생산량의 20%만 만들지만 불량품 가운데서는 거의 절반을 차지합니다. 같은 방식으로 기계 1과 2는 5/21, 6/21이고, 세 값의 합은 1입니다. 불량이라는 사실을 알게 되면 불량률이 높은 기계 쪽으로 확률이 옮겨 갑니다.

정리

확률은 무작위 실험의 결과를 모은 표본공간과 그 부분집합인 사건 위에 정의합니다. 세 공리에서 공집합, 여사건, 합집합의 성질을 모두 증명할 수 있습니다. 조건부확률은 조건 사건을 새 전체집합으로 삼아 비율을 다시 재는 일이고, 곱셈 꼴을 이어 쓰면 연쇄법칙이 됩니다. 분할 위에서 경우를 나눠 더하면 전확률정리, 결과에서 원인 쪽으로 거꾸로 물으면 베이즈 정리입니다. 다음 글에서는 조건을 걸어도 확률이 바뀌지 않는 독립을 보고, 같은 확률의 결과를 세어 확률을 구하는 방법으로 넘어갑니다.

dev-news학습 노트소개개인정보 처리