모집단 전체를 조사하기 어려울 때 일부를 추출하여 조사하는 것이 표본조사입니다. 표본추출 방법에는 네 가지가 있습니다. 단순무작위추출법은 모집단의 모든 개체가 동일한 확률로 추출되는 가장 기본적인 방법입니다. 계통추출법(체계추출법)은 모집단에 일련번호를 부여한 후, N/n=k(추출 간격)를 계산하여 1k 중 첫 번째 표본을 무작위로 선택(r)하고, 이후 r, r+k, r+2k, ... 순으로 일정 간격으로 표본을 선택하는 방법입니다. 규칙성이 있는 모집단에 적용 시 편향이 발생할 수 있다는 단점이 있습니다. 층화추출법은 모집단을 서로 중복되지 않는 여러 그룹(층, strata)으로 나눈 다음, 각 층에서 무작위로 표본을 추출하는 방법입니다. 모집단의 특성을 잘 반영할 수 있다는 장점이 있습니다. 집락추출법(군집추출법)은 모집단을 여러 집단(군집)으로 나눈 후 일부 군집을 먼저 선택하고, 선택된 군집 내에서 표본을 추출하는 다단계 방법입니다. 표본조사에서 발생하는 오차는 표본오차와 비표본오차로 나뉩니다. 표본오차는 표본이 모집단을 완벽히 대표하지 못해서 생기는 오차이며, 표본 크기가 커질수록 줄어듭니다. 비표본오차는 측정 실수, 응답 거부, 잘못된 질문 설계 등 표본 추출 방법과 무관하게 발생하는 오차입니다. "표본추출을 통해 비표본오차를 최소화할 수 있다"는 설명은 틀린 것입니다. 핵심 요약 & 시험 포인트 4가지 표본추출 방법 방법 절차 특징 단순무작위추출 모든 개체 동일 확률 가장 기본, 전제 조건 계통추출(체계추출) 간격 k=N/n으로 일정 추출 주기적 패턴 있으면 편향 발생 위험 층화추출 층(strata) 구분 후 각 층에서 무작위 모집단 특성 잘 반영 집락추출(군집추출) 군집 선택 후 내부 추출 비용 절감, 다단계 추출 오차 구분 오차 의미 줄이는 방법 표본오차 표본이 모집단을 완벽 대표 못해 발생 표본 크기 증가 비표본오차 측정 실수·응답 거부·설계 오류 등 표본추출로 해결 불가 시험 포인트: 계통추출법은 주기적 패턴 모집단에서 편향 위험. "비표본오차는 표본추출로 최소화"는 틀린 설명. 집략→집락추출법이 정확한 표기. 확률 표본추출 4가지 방법 (필수 암기) 방법 절차 장단점 단순랜덤추출 (Simple Random Sampling) 모집단에서 무작위 n개 추출 단순/공정, 모집단 정보 필요 계통추출 (Systematic Sampling) k번째마다 추출 (k = N/n) 간편, 주기성 있으면 편향 층화추출 (Stratified Sampling) 모집단을 동질 층(Stratum)으로 나누고 비율대로 추출 정밀도↑, 층 정의 필요 집락추출 (Cluster Sampling) 모집단을 집락(Cluster)으로 나눠 일부 집락 전체 조사 비용↓, 정확도↓ 층화 vs 집락 비교 (시험 단골) 구분 층화추출 집락추출 그룹 내 동질성 높음 (비슷한 것끼리) 낮음 (전체 모집단 축소판) 그룹 간 동질성 낮음 (층끼리 다름) 높음 표본 추출 모든 층에서 추출 일부 집락만 선택 비확률 표본추출 - 편의추출: 접근하기 쉬운 대상 (표본 편향 위험) - 할당추출: 특정 비율로 미리 할당 (조사원 판단) - 눈덩이추출: 응답자가 다른 응답자 소개 (희귀 모집단) 시험 포인트: 층화는 "층 내 동질·층 간 이질", 집락은 그 반대. 계통추출은 주기성에 주의. 추가 핵심 개념 — 중심극한정리와 복원/비복원 추출 - 중심극한정리(CLT, Central Limit Theorem): 표본 크기 n이 충분히 크면(보통 n ≥ 30) 모집단 분포 형태와 무관하게 표본평균 X̄의 분포가 정규분포 N(μ, σ²/n)에 근사. 표준오차 SE = σ/√n. - 복원추출(Sampling with Replacement): 추출한 표본을 모집단에 되돌려놓고 다시 추출. 같은 개체가 여러 번 선택 가능. 부트스트랩(Bootstrap)·배깅의 기반. - 비복원추출(Sampling without Replacement): 한 번 추출된 개체는 다시 뽑지 않음. 모집단이 충분히 클 때는 복원추출과 거의 같은 결과. - 부트스트랩(Bootstrap): 원본 데이터에서 동일 크기 n의 표본을 복원추출로 반복 생성해 통계량의 분포·신뢰구간을 추정. OOB(Out-Of-Bag) = 부트스트랩에 한 번도 뽑히지 않는 약 36.8%(= 1/e) 데이터로 랜덤포레스트 검증에 활용. 시험 핵심: CLT의 n ≥ 30 조건, 부트스트랩의 OOB ≈ 36.8% (=1/e)는 자주 출제됩니다. 평가 데이터 분할 방식 - 홀드아웃(Holdout): 데이터를 학습/검증/평가로 단순 분할 (예: 70/15/15). 가장 단순하나 분할에 따른 분산 큼 - K-겹 교차검증(K-fold Cross-Validation): 데이터를 K개 폴드로 나눠 K번 학습·평가 후 평균. K=5 또는 10이 일반적 - 계층적 K-겹(Stratified K-fold): 각 폴드에 클래스 비율을 유지 — 불균형 데이터에 권장 - Leave-one-out(LOOCV): K = n인 극단적 K-fold. 정확하나 계산 비용 큼(n번 학습) - 부트스트랩 vs 교차검증: 부트스트랩은 복원추출, K-fold는 비복원 분할 표본추출 방법 정리 - 단순임의추출(Simple Random Sampling): 모든 원소가 동일한 확률로 추출 — 가장 기본 - 계통추출(Systematic Sampling): k = N/n 간격으로 일정하게 추출 (예: 매 10번째) - 층화추출(Stratified Sampling): 모집단을 동질적인 층으로 나누고 각 층에서 임의 추출 — 층 내 동질·층 간 이질 - 군집추출(Cluster Sampling): 모집단을 군집으로 나누고 일부 군집 전체를 조사 — 비용 절감 - 비복원 vs 복원: 추출된 표본을 다시 모집단에 넣는지 여부 불균형 데이터 샘플링 - 오버샘플링(Oversampling): 소수 클래스를 복제·합성하여 늘림 (예: SMOTE·ADASYN) - 언더샘플링(Undersampling): 다수 클래스를 일부만 선택하여 줄임 (예: Tomek Links·ENN) - SMOTE-ENN / SMOTETomek: 합성 + 정제를 결합한 하이브리드 기법 비확률 표본추출 (Non-probability Sampling) - 편의추출(Convenience Sampling): 가장 접근하기 쉬운 표본 (대학생·온라인 사용자) — 편향 가능성 큼 - 판단추출(Judgment Sampling): 연구자의 판단으로 대표성 있다고 판단되는 표본 선택 - 할당추출(Quota Sampling): 모집단의 비율과 동일하게 할당 (예: 성별·연령별 비율) - 눈덩이 추출(Snowball Sampling): 초기 표본이 다른 표본을 추천 — 희귀집단·은밀한 모집단 조사에 사용 확률 vs 비확률 표본 - 확률표본(Probability Sample): 모든 원소의 추출 확률이 알려져 있음 → 통계적 추론 가능 - 비확률표본: 추출 확률 불명 → 일반화 어려움, 탐색적 연구에 사용 추정량의 좋은 성질 - 점추정(Point Estimation): 모수의 단일값 추정 - 구간추정(Interval Estimation): 신뢰구간 형태로 추정 - 추정량(Estimator): 표본 함수 (예: 표본평균 X̄) - 불편성(Unbiasedness): E(추정량) = 모수 — 편향 없음 - 효율성(Efficiency): 분산이 작을수록 효율적 - 일치성(Consistency): 표본 크기가 커지면 모수에 확률수렴 - 충분성(Sufficiency): 표본 정보를 모두 사용 - 표본통계량(Sample Statistic): 표본에서 계산된 값 (X̄·s·p̂) 복원 vs 비복원 추출 - 복원 표본(Sampling with Replacement): 한 번 뽑은 원소를 다시 모집단에 넣음 — 부트스트랩의 기본 - 비복원 표본(Sampling without Replacement): 뽑은 원소를 제외 — 같은 원소가 두 번 등장 안 함 - 모집단이 충분히 크면 두 방식의 결과가 거의 동일 데이터 분할 (Train/Validation/Test) - 훈련 집합(Training Set): 모델 학습용 — 보통 6080% - 검증 집합(Validation Set): 하이퍼파라미터 튜닝·모델 선택 — 1020% - 시험 집합(Test Set): 최종 성능 평가용 — 1020% - 흔한 비율: 70/15/15 또는 60/20/20 - 검증용 데이터(Validation Data) vs 시험용 데이터(Test Data): 검증은 모델 선택, 시험은 최종 평가 — 시험 데이터는 학습·튜닝에 절대 사용 금지 표본통계량 핵심 - 표본 평균(x̄): Σxᵢ / n — 모평균 μ의 비편향 추정량 - 표본 분산(s²): Σ(xᵢ−x̄)² / (n−1) — 모분산 σ²의 비편향 추정량 (분모 n−1은 자유도) - 표본 비율(p̂): 성공 횟수 / n — 모비율 p의 비편향 추정량 - 비편향 추정량(Unbiased Estimator): E(추정량) = 모수 — 편향이 0인 추정량 - 분모를 n으로 하면 분산은 편향됨(편향된 분산) → 자유도 보정 필요 표본 분포 관련 - 표본 분산의 분포: (n−1)s²/σ² χ²(n−1) — 정규 모집단 가정 - 표본 비율의 분포: 큰 표본에서 N(p, p(1−p)/n)으로 근사 (CLT) 표본 편향 - 선택 편향(Selection Bias): 비무작위 표본 추출로 인한 체계적 편향 - 자가선택 편향(Self-selection bias) - 비응답 편향(Non-response bias) - 생존자 편향(Survivorship bias) - 표본통계량의 분포(Sampling Distribution): 동일한 모집단에서 무한히 표본 추출 시 표본통계량이 따르는 분포 인과 추론용 표본 매칭 - 성향 점수(Propensity Score): 관측 공변량으로 처치 받을 확률을 추정 - 성향 점수 매칭: 처치·통제 집단에서 비슷한 성향 점수를 가진 짝을 매칭 → 관측 가능 교란 완화 오차의 종류 - 표본오차(Sampling Error): 전수조사가 아닌 표본조사에서 필연적으로 발생하는 오차 — 표본 크기 증가로 감소 - 비표본오차(Non-sampling Error): 표본추출과 무관한 오차 — 측정 오류·코딩 오류·비응답·자료 처리 실수 - 비표본오차는 표본을 키워도 줄어들지 않음 → 조사 설계·실행의 품질이 중요 층화추출의 할당 방법 - 비례 할당(Proportionate Allocation): 모집단 비율과 동일하게 층별 표본 크기 결정 - nₕ = n × (Nₕ/N) - 비비례 할당(Disproportionate Allocation): 층별 표본 크기를 다르게 (분산·중요도 고려) - 등 할당(Equal Allocation): 모든 층에 동일한 표본 크기 - Neyman Allocation: 층별 분산을 고려한 최적 할당 — nₕ ∝ Nₕ·σₕ 표본추출 명칭 변형 - 단순 무작위 추출 / 단순임의추출(Simple Random Sampling): 모두 동일 — 모든 원소가 동등한 추출 확률 - 계통 추출 / 계통추출(Systematic Sampling): 일정 간격으로 추출 - 층화 추출 / 층화추출(Stratified Sampling): 동질적 층으로 나누고 각 층에서 무작위 - 집락/군집 추출 / 집락추출 / 군집추출(Cluster Sampling): 집락 단위로 추출 - ADsP 시험에서는 두 가지 표기가 모두 사용됨 — 동일 개념으로 인식 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - K-겹 교차검증 — 데이터를 K개 폴드로 나눠 K번 학습·평가 후 평균. K=5 또는 10이 일반적 - 계층적 K-겹 — 각 폴드에 클래스 비율을 유지 — 불균형 데이터에 권장 - Leave-one-out — K = n인 극단적 K-fold. 정확하나 계산 비용 큼(n번 학습) - 부트스트랩 vs 교차검증 — 부트스트랩은 복원추출, K-fold는 비복원 분할 - 단순임의추출 — 모든 원소가 동일한 확률로 추출 — 가장 기본 - 비복원 vs 복원 — 추출된 표본을 다시 모집단에 넣는지 여부 - 언더샘플링 — 다수 클래스를 일부만 선택하여 줄임 (예: Tomek Links·ENN) - SMOTE-ENN / SMOTETomek — 합성 + 정제를 결합한 하이브리드 기법 - 판단추출 — 연구자의 판단으로 대표성 있다고 판단되는 표본 선택 - 할당추출 — 모집단의 비율과 동일하게 할당 (예: 성별·연령별 비율) - 표본 비율의 분포 — 큰 표본에서 N(p, p(1−p)/n)으로 근사 (CLT) - 선택 편향 — 비무작위 표본 추출로 인한 체계적 편향 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
표본추출 방법
과목: 데이터 분석 (3과목, 3번 주제) ·
키워드: 표본추출 · 군집분석 · 모형 평가 · 표본조사
정의: 모집단 전체를 조사하기 어려울 때 일부를 추출하여 조사하는 것이 표본조사입니다.
핵심 Q&A (7개)
- 층화추출법과 집락추출법의 차이는?
- 층화: 층 구분 후 각 층에서 무작위 추출 (모집단 특성 반영 우수)
집락: 군집 선택 후 그 내부에서 추출 (비용 절감) - 계통추출법의 단점은?
- 주기적 패턴이 있는 모집단에 적용하면 편향 발생 위험
예: 공장 라인에서 10번째마다 추출 → 불량품만 추출될 수 있음 - 표본오차를 줄이는 방법은?
- 표본 크기를 늘린다.
표본오차는 표본 크기가 클수록 줄어든다. - 비표본오차는 표본추출로 줄일 수 있나?
- ❌ 아니다. 비표본오차는 측정 실수·응답 거부·설계 오류 등
표본추출 방법과 무관하게 발생한다. - 계통추출법의 절차는?
- ① N/n=k (추출 간격) 계산
② 1~k 중 시작점 r 무작위 선택
③ r, r+k, r+2k, ... 순으로 추출 - 확률 표본추출 4가지는?
- 단순랜덤추출, 계통추출(k번째마다), 층화추출(층별 비율), 집락추출(집락 단위 전수)
- 층화추출 vs 집락추출 차이는?
- 층화: 층 내 동질·층 간 이질, 모든 층에서 추출
집락: 집락 내 이질(축소판)·집락 간 동질, 일부 집락만 선택