확률이란 어떤 사건이 일어날 가능성을 0에서 1 사이의 숫자로 나타낸 것입니다. 확률이 0이면 절대 일어나지 않고, 1이면 반드시 일어나며, 0.5이면 일어날 가능성과 일어나지 않을 가능성이 같습니다. 두 사건이 독립사건(서로 영향을 주지 않음)이고, 독립일 때, 두 사건이 동시에 일어날 확률은 각 사건의 확률을 곱한 것입니다. P(A∩B)=P(A)×P(B)입니다. 시험에서 "두 독립 사건의 동시 발생 확률은 두 확률의 합"이라는 보기가 나오면 틀린 것입니다. 합이 아니라 곱입니다. 조건부확률은 사건 A가 일어났을 때 사건 B가 일어날 확률로 P(B A)=P(A∩B)/P(A)로 계산합니다. 베이즈 정리는 조건부확률을 이용해 사전확률로부터 사후확률을 계산하는 이론입니다. P(A B) = P(B A)×P(A)/P(B) 형태로 표현되며, 새로운 증거(B)를 관찰한 후에 기존의 믿음(사전확률 P(A))을 업데이트하여 사후확률 P(A B)를 구합니다. 예) 스팸 필터: 단어 'FREE'가 등장할 때 스팸일 확률을 계산하는 데 사용합니다. 기대값은 확률변수가 취할 수 있는 각 값에 해당 확률을 곱하여 모두 더한 것입니다. 예를 들어 P(X=1)=0.4, P(X=2)=0.3, P(X=3)=0.2, P(X=4)=0.1이면 E(X)=1×0.4+2×0.3+3×0.2+4×0.1=2.0입니다. 중심극한정리는 모집단의 분포가 어떤 형태이든, 표본의 크기가 충분히 크면 표본 평균의 분포가 정규분포에 가까워진다는 정리입니다. 모집단이 반드시 정규분포를 따를 필요는 없으며, 모집단의 분포가 비대칭일수록 정규분포에 가까워지기 위해 더 큰 표본 크기가 필요합니다. 일반적으로 표본 크기 n≥30이면 중심극한정리를 적용할 수 있다고 봅니다. "중심극한정리는 모집단이 정규분포를 따를 때만 성립한다"는 보기가 나오면 틀린 설명입니다. 주요 확률분포 정리 이산확률분포 분포 의미 모수 이항분포 B(n,p) n번 시행 중 성공 횟수 n, p 포아송 P(λ) 일정 시간 내 사건 발생 횟수 λ (평균=분산) 기하분포 첫 성공까지의 시행 횟수 p 음이항분포 r번째 성공까지의 시행 횟수 r, p 연속확률분포 분포 의미 특징 균등분포 U(a,b) [a,b] 사이 모든 값이 같은 확률 평균=(a+b)/2 정규분포 N(μ,σ²) 종 모양 좌우대칭 평균=중앙값=최빈값 지수분포 Exp(λ) 사건 간 시간 간격, 무기억성 평균=1/λ 카이제곱(χ²) 정규분포 제곱합 (자유도 k) 분산 추정·검정 t분포 표본이 작을 때 정규 대신 (자유도 n-1) 평균 추정 F분포 두 카이제곱의 비 ANOVA·분산 비교 시험 포인트: 포아송은 평균=분산. 지수분포는 "무기억성" (기억하지 않음). t분포는 자유도가 커지면 정규분포에 수렴. 추가 핵심 개념 — 베르누이 시행과 분포 관계 - 베르누이 시행(Bernoulli Trial): 결과가 성공(1)·실패(0)로만 나타나는 단일 시행. P(X=1) = p, P(X=0) = 1-p. 평균 = p, 분산 = p(1-p). - 이항분포 B(n, p): 베르누이 시행을 n번 반복한 성공 횟수의 분포. 평균 = np, 분산 = np(1-p). - 분포 간 근사 관계: - 이항 B(n, p): n↑·p작음(np=λ 일정) → 포아송 P(λ) 근사 (드문 사건) - 이항 B(n, p): n↑·p≈0.5 → 정규분포 N(np, np(1-p)) 근사 (CLT) - 포아송 사건 간격 → 지수분포 Exp(λ) (무기억성, Memoryless) - 백색잡음(White Noise): 평균 0·일정 분산·자기상관 0인 정상 시계열. ARIMA 잔차의 이상적 가정. 시험 핵심: 베르누이 → 이항 → 포아송 → 지수의 관계와 근사 조건이 시계열·확률에서 자주 묶여 출제됩니다. 베이지안 추론 - 베이즈 정리: P(A B) = P(B A)·P(A) / P(B) - 사전확률(Prior): 데이터 관찰 전 신념. P(A) - 우도(Likelihood): 가설이 참일 때 데이터가 관찰될 확률. P(B A) - 사후확률(Posterior): 데이터 관찰 후 갱신된 신념. P(A B) - 최대우도추정(MLE, Maximum Likelihood Estimation): 우도함수를 최대화하는 모수 추정. 회귀·로지스틱회귀·신경망 학습의 기본 원리 - 베이지안 추론: 빈도주의(고정 모수)와 달리 모수를 확률변수로 보고 사전·사후 분포로 업데이트 표본분포 관련 - 표준오차(SE): 추정량의 표준편차. 표본평균의 SE = σ/√n 확률 함수 종류 - 확률질량함수(PMF, Probability Mass Function): 이산형 확률변수의 각 값에 대한 확률 - 확률밀도함수(PDF, Probability Density Function): 연속형 확률변수의 밀도 — 적분이 확률 - 누적분포함수(CDF, Cumulative Distribution Function): P(X ≤ x) — 모든 확률변수에 정의 추가 분포 - 초기하분포(Hypergeometric): 비복원추출에서 성공 횟수 분포 (예: 모집단 N개 중 K개 성공, n개 비복원 추출) - 기하분포(Geometric): 첫 성공까지의 시행 횟수 - 음이항분포(Negative Binomial): r번째 성공까지의 시행 횟수 - 감마분포(Gamma): 양의 연속 확률변수 — 대기시간·수명 분석에 사용 - 베타분포(Beta): [0, 1] 구간의 연속분포 — 비율·확률의 사전분포로 자주 사용 - t 분포: 정규분포와 유사하나 꼬리 두꺼움. 자유도가 커질수록 정규에 수렴 — 소표본 평균검정에 사용 - F 분포: 두 카이제곱 분포의 비율 — ANOVA·분산비 검정에 사용 통계 극한정리 - 큰 수의 법칙(LLN): 표본 크기가 커질수록 표본평균이 모평균에 수렴 - 중심극한정리(CLT): 표본 크기가 충분히 크면 표본평균의 분포가 정규분포에 근사 - 체비셰프 부등식(Chebyshev): 분포 형태와 무관하게 P( X−μ ≥ kσ) ≤ 1/k² 베르누이 분포 - 베르누이 시행(Bernoulli Trial): 결과가 성공/실패 둘뿐인 시행 - 베르누이 분포 Bern(p): P(X=1) = p, P(X=0) = 1−p — 이항분포의 기본 단위 - 기댓값 E(X) = p, 분산 Var(X) = p(1−p) 기댓값과 분산의 성질 - E(aX + b) = aE(X) + b - Var(aX + b) = a²Var(X) (b는 영향 없음) - 독립 시: Var(X+Y) = Var(X) + Var(Y) - 공분산이 있을 때: Var(X+Y) = Var(X) + Var(Y) + 2Cov(X, Y) 조건부 확률 - 조건부 확률: P(A B) = P(A∩B) / P(B) - 전확률의 정리: P(A) = Σ P(A Bᵢ)P(Bᵢ) — 표본공간 분할 활용 - 사건의 독립: P(A∩B) = P(A)P(B) ⇔ P(A B) = P(A) 다변량 정규분포 - 다변량 정규분포(Multivariate Normal Distribution, MVN): 여러 변수가 결합 정규분포를 따르는 분포 - 모수: 평균 벡터 μ와 공분산행렬 Σ - 표준화 변량: (X − μ) / σ — 단변량 표준화의 일반화는 마할라노비스 거리 - 이항확률: 베르누이 시행을 n번 반복한 성공 횟수의 분포 — Bin(n, p) - 확률밀도(PDF)와 확률분포함수(CDF)의 구분: PDF는 미분, CDF는 적분으로 연결 모수 표기 - 모분산(σ², Population Variance): 모집단의 분산 - 모표준편차(σ): 모분산의 제곱근 - 모비율(p, Population Proportion): 모집단에서 특정 속성의 비율 - 모수는 일반적으로 알 수 없고, 표본통계량으로 추정 모형의 분류 - 확률 모형(Stochastic / Probabilistic Model): 무작위성을 가진 모형 — 같은 입력에서 다른 결과 가능 (예: 회귀, 마르코프, 베이지안) - 결정 모형(Deterministic Model): 입력이 같으면 항상 같은 결과 — 수학적 공식·물리 모델 - 빅데이터·ML 모형은 대부분 확률 모형 확률의 공리 (Kolmogorov) 1. 비음성: P(A) ≥ 0 2. 정규화: P(전체 표본공간) = 1 3. 가법성: 서로 배반 사건이면 P(A∪B) = P(A) + P(B) 선형대수와 확률 - 양의 정부호(Positive Definite) / PSD(Positive Semi-Definite, 양의 준정부호): 모든 고유값이 양수(또는 0 이상)인 행렬 — 공분산행렬은 항상 PSD - 공분산행렬의 PSD 성질: 분산이 음수가 될 수 없음에서 유도 - 정규화 상수(Normalizing Constant) / Evidence: 베이즈 정리의 분모 P(데이터) — 사후분포가 확률이 되도록 정규화 포아송 분포 추가 - 포아송 분포(Poisson Distribution): 단위 시간·공간에서의 사건 발생 횟수 — Pois(λ) - 평균 = 분산 = λ (포아송의 특성) - 응용: 콜센터 통화 수, 단위 면적당 결함 수, 단위 시간 방문자 수 다변량 확률 분포 - 결합분포(Joint Distribution): 두 개 이상의 확률변수의 동시 분포 P(X, Y) - 주변분포(Marginal Distribution): 결합분포에서 하나의 변수에 대한 분포 P(X) = ΣP(X, Y) - 조건분포(Conditional Distribution): 한 변수가 주어졌을 때 다른 변수의 분포 P(Y X) = P(X, Y)/P(X) - 독립: P(X, Y) = P(X)·P(Y) ⇔ P(Y X) = P(Y) - 배반사건(Mutually Exclusive): P(A∩B) = 0 — 동시 발생 불가 - 독립 vs 배반: 독립과 배반은 다른 개념 (배반이면 보통 독립 아님) 표본평균의 표준오차 (SE) - 표본평균의 표준오차(SE of Sample Mean): σX̄ = σ / √n - σ: 모표준편차 - n: 표본 크기 - 표본이 커질수록 표준오차 감소 → 표본평균이 모평균에 가까워짐 - 모표준편차를 모르면 표본표준편차 s로 대체: SE = s / √n - 신뢰구간 = X̄ ± z·SE (z는 임계값, 95%면 1.96) 표본비율의 표준오차 - 표본비율의 표준오차: SEp̂ = √[p̂(1−p̂)/n] - 표본 크기에 따라 신뢰구간 폭 결정 자유도 추가 정리 - 자유도(Degrees of Freedom): 통계량 계산에서 자유롭게 변할 수 있는 값의 수 - 표본분산 s²: df = n−1 (평균이 고정되어 1 차감) - 카이제곱·t·F 분포는 자유도가 분포 모양을 결정 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 베이지안 추론 — 빈도주의(고정 모수)와 달리 모수를 확률변수로 보고 사전·사후 분포로 업데이트 - 확률질량함수 — 이산형 확률변수의 각 값에 대한 확률 - 초기하분포 — 비복원추출에서 성공 횟수 분포 (예: 모집단 N개 중 K개 성공, n개 비복원 추출) - 감마분포 — 양의 연속 확률변수 — 대기시간·수명 분석에 사용 - 베타분포 — [0, 1] 구간의 연속분포 — 비율·확률의 사전분포로 자주 사용 - t 분포 — 정규분포와 유사하나 꼬리 두꺼움. 자유도가 커질수록 정규에 수렴 — 소표본 평균검정에 사용 - F 분포 — 두 카이제곱 분포의 비율 — ANOVA·분산비 검정에 사용 - 큰 수의 법칙 — 표본 크기가 커질수록 표본평균이 모평균에 수렴 - 체비셰프 부등식 — 분포 형태와 무관하게 P( X−μ ≥ kσ) ≤ 1/k² - E= aE+ b — Var(aX + b) = a²Var(X) (b는 영향 없음) - 표준화 변량 — (X − μ) / σ — 단변량 표준화의 일반화는 마할라노비스 거리 - 이항확률 — 베르누이 시행을 n번 반복한 성공 횟수의 분포 — Bin(n, p) - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
확률의 기초와 확률분포
과목: 데이터 분석 (3과목, 2번 주제) ·
키워드: 기술통계 · 확률분포 · 확률 · 점추정·구간추정
정의: 확률이란 어떤 사건이 일어날 가능성을 0에서 1 사이의 숫자로 나타낸 것입니다.
핵심 Q&A (9개)
- 베이즈 정리 공식은?
- P(A|B) = P(B|A) × P(A) / P(B)
사후확률 = 우도 × 사전확률 / 증거 - 조건부 확률 P(A|B)의 의미는?
- B가 발생했다는 조건 하에 A가 발생할 확률
P(A|B) = P(A∩B) / P(B) - 이항분포의 조건은?
- ① 독립 시행 ② 각 시행은 성공/실패 두 결과
③ 성공 확률 p가 일정
X~B(n, p) - 포아송 분포란?
- 일정 시간/영역에서 사건 발생 횟수를 나타내는 이산 분포
예: 1시간 동안 콜센터에 걸려오는 전화 수 - 포아송 분포의 평균과 분산의 관계는?
- **평균 = 분산 = λ** (시험 빈출)
다른 분포와 달리 단일 모수 λ가 평균과 분산을 모두 결정
검정 시 평균≠분산이면 음이항 회귀 등 대안 검토 - 정규분포의 특징 3가지는?
- ① 좌우 대칭, 왜도=0
② 평균=중앙값=최빈값
③ 68-95-99.7 규칙 (1σ/2σ/3σ 범위) - 지수분포의 특성과 평균은?
- 사건 간의 시간 간격을 모델링하는 연속분포
무기억성(Memoryless): P(X>s+t|X>s) = P(X>t)
평균 = 1/λ, 분산 = 1/λ² - 검정에 사용되는 3가지 분포(χ²/t/F)의 용도는?
- 카이제곱(χ²): 분산 검정, 적합도/독립성 검정
t분포: 표본 작을 때 평균 검정 (자유도 n-1)
F분포: 두 분산 비교, ANOVA - t분포는 자유도가 커지면 어떻게 되나?
- 자유도 ↑ → 표준정규분포 N(0,1)에 수렴
표본 크기가 클수록 t분포 ≈ 정규분포 (n≥30 부근부터 사실상 동일)
표본이 작을수록 꼬리가 두꺼워짐