통계 분석의 첫걸음은 데이터를 측정하는 척도의 종류를 이해하는 것입니다. 척도는 네 가지 수준으로 나뉘며, 각 수준에 따라 적용할 수 있는 분석 방법이 달라집니다. 명목척도는 단순히 범주를 구분하기 위한 것으로, 숫자에 수학적 의미가 없습니다. 성별(남/여), 혈액형(A/B/O/AB), 거주지역(수도권/비수도권) 등이 해당됩니다. 서열척도는 범주 간에 순서(서열)가 있지만 간격이 동일하지는 않습니다. 학년(1학년<2학년<3학년), 만족도 등급(매우불만<불만<보통<만족<매우만족)이 예입니다. 등간척도는 범주 간 간격이 동일하지만 절대적 영점(0)이 없는 척도입니다. 온도(섭씨 0도가 "온도가 없다"를 뜻하지 않음), 시험 점수가 해당됩니다. 비율척도는 절대적 영점(0)이 존재하여 비율 계산이 가능한 척도입니다. 키, 몸무게, 나이, 소득 등이 해당되며 "몸무게 0kg은 무게가 없다"를 의미합니다. 기술통계는 수집된 데이터를 표나 그래프, 수치 요약 등으로 정리하여 데이터의 특성을 파악하는 방법입니다. 대표값에는 평균(모든 값의 합을 개수로 나눈 것), 중앙값(데이터를 크기순으로 나열했을 때 가운데 값), 최빈값(가장 자주 나타나는 값)이 있습니다. 산포도 측정에는 분산, 표준편차, 사분위범위(IQR) 등이 사용됩니다. IQR은 제3사분위수(Q3)에서 제1사분위수(Q1)를 뺀 값으로, 데이터의 중앙 50%가 흩어진 정도를 나타냅니다. IQR은 이상치(Outlier)의 영향을 받지 않는 로버스트(Robust)한 산포 지표라는 점이 중요합니다. 상자그림(Box Plot)에서 이상치 판단 기준은 하한=Q1-1.5×IQR, 상한=Q3+1.5×IQR입니다. 정규분포는 평균을 중심으로 좌우 대칭인 종 모양의 분포로, 왜도(Skewness)=0(좌우 대칭), 첨도(Kurtosis)=3(또는 초과 첨도=0)인 특성을 가집니다. "정규분포의 왜도는 1이다"라는 보기가 나오면 0이므로 틀린 설명입니다. 평균=중앙값=최빈값이 모두 같은 것도 정규분포의 중요한 특성입니다. 반면 오른쪽(양) 꼬리 분포에서는 최빈값 < 중앙값 < 평균이고, 왼쪽(음) 꼬리 분포에서는 평균 < 중앙값 < 최빈값의 순서가 됩니다. 핵심 요약 & 시험 포인트 4가지 척도 비교 척도 특징 허용 연산 예시 명목(Nominal) 분류만 가능, 순서 없음 빈도, 최빈값 혈액형, 성별 서열(Ordinal) 순서 있음, 간격 불균등 중앙값, 순위 만족도 순위, 학점 등간(Interval) 동일 간격, 절대 0 없음 평균, 표준편차 섭씨 온도, IQ 비율(Ratio) 절대 0 있음, 비율 의미 모든 연산 키·몸무게·연봉 분포의 모양과 대표값 순서 분포 순서 정규분포 평균 = 중앙값 = 최빈값 오른쪽 꼬리(양의 왜도) 최빈값 < 중앙값 < 평균 왼쪽 꼬리(음의 왜도) 평균 < 중앙값 < 최빈값 시험 포인트: 등간척도의 절대 0 예 = 섭씨 온도(0°C는 온도 없음이 아님). 비율척도의 절대 0 예 = 몸무게(0kg = 없음). 정규분포 왜도=0, 첨도=3. 모집단 vs 표본, 모수 vs 통계량 개념 모집단(Population) 표본(Sample) 정의 관심 대상 전체 모집단의 일부 (조사 대상) 측정값 모수(Parameter) 통계량(Statistic) 표기 μ(평균), σ(표준편차), p(비율) x̄, s, p̂ 성격 고정된 상수 (보통 미지수) 표본마다 변하는 확률변수 추정(Estimation)의 두 가지 방법 - 점추정(Point Estimation): 모수를 하나의 값으로 추정 (x̄으로 μ 추정) - 구간추정(Interval Estimation): 신뢰구간으로 추정 (95% CI) 좋은 추정량의 성질 성질 의미 불편성(Unbiasedness) E(추정량) = 모수 (편향이 0) 효율성(Efficiency) 분산이 가장 작은 추정량 일치성(Consistency) 표본 크기 n→∞ 일 때 모수에 수렴 충분성(Sufficiency) 모수에 대한 모든 정보를 담음 시험 포인트: 모수는 고정된 미지의 상수, 통계량(표본 통계)은 확률변수. 표본평균 x̄은 모평균 μ의 불편추정량. 분포 형태 측정 지표 - 표본분산(s²): Σ(x - x̄)² / (n−1) — 자유도(n−1)를 사용하는 불편추정량 - 표본표준편차(s): √s² — 분산의 단위를 원자료와 일치시킨 산포 측도 - 변동계수(CV, Coefficient of Variation): (표준편차 / 평균) × 100 — 단위·평균이 다른 그룹 간 산포 비교 시 사용. 평균이 0에 가까우면 사용 불가 - 왜도(Skewness): 분포 비대칭 정도. 0 우측 꼬리(오른쪽으로 치우침), <0 좌측 꼬리, =0 대칭 - 첨도(Kurtosis): 분포 뾰족함. 정규분포=3(Fisher 정의로는 0), 0 더 뾰족, <0 더 평평 평균의 종류 - 산술평균: 일반적 평균 (Σx/n) - 기하평균: ⁿ√(x₁·x₂···xₙ) — 비율·성장률 평균에 사용 - 조화평균: n / Σ(1/xᵢ) — 속도·F1-score 등 비율의 평균 Z-점수와 백분위수 - Z-점수: (x − μ) / σ — 평균에서 몇 표준편차 떨어졌는지. 표준정규분포로 변환 - 백분위수(Percentile): 자료를 작은 값부터 정렬 시 p%에 해당하는 위치값. Q1=25%, Q2(중앙값)=50%, Q3=75% 4대 척도 (Stevens, 1946) - 명목척도(Nominal Scale): 분류만 가능 (성별·혈액형) — 산술 연산 불가 - 서열척도(Ordinal Scale): 순서 의미 (등급·만족도) — 크기 비교 가능, 간격은 동일하지 않음 - 등간척도(Interval Scale): 간격이 일정 (온도·연도) — 덧셈/뺄셈 가능, 절대 0 없음 - 비율척도(Ratio Scale): 절대 0 존재 (무게·길이·소득) — 모든 연산 가능 - 척도가 높을수록 더 많은 통계 분석 가능 — Nominal < Ordinal < Interval < Ratio 도수분포와 그래프 - 도수(Frequency): 각 계급(class)에 속하는 자료의 개수 - 상대도수(Relative Frequency): 도수 / 전체 — 비율 - 누적도수(Cumulative Frequency): 해당 계급까지의 도수 합 - 도수분포표: 계급별 도수·상대도수·누적도수를 표로 정리 - 줄기-잎 그림(Stem-and-Leaf): 줄기(상위 자릿수) + 잎(하위 자릿수)으로 분포 표시 — 원자료 보존 - 단봉(Unimodal)/다봉(Multimodal)/이봉(Bimodal): 분포의 봉우리 수 — 하위 집단 존재 시 다봉 대칭·왜도 - 대칭도(Symmetry): 평균을 중심으로 좌우 대칭 정도 - 비대칭도(Asymmetry, Skewness): 왜도와 동일 개념 - MAD(Median Absolute Deviation, 중앙값 절대편차): 중앙값 기반 산포 측도 — 이상치에 강건 통계학의 두 갈래 - 기술 통계(Descriptive Statistics): 자료를 요약·시각화·정리하는 통계 - 평균·중앙값·최빈값(중심 경향) - 분산·표준편차·범위·IQR(산포) - 왜도·첨도(분포 형태) - 표·그래프·도수분포 - 추론 통계(Inferential Statistics): 표본으로 모집단을 추정·검정·예측 - 점추정·구간추정 - 가설검정 - 회귀·상관 분석 분석 단계별 명칭 - 기술적 분석(Descriptive Analytics): 무슨 일이 일어났는가 — 기술 통계와 시각화 - 진단적 분석(Diagnostic): 왜 일어났는가 - 예측적 분석(Predictive): 무엇이 일어날 것인가 - 처방적 분석(Prescriptive): 무엇을 해야 하는가 강건 통계량 - 절사평균(Trimmed Mean): 양 끝의 일정 비율(예: 10%)을 제외하고 계산한 평균 — 이상치에 강건 - 윈저화 평균(Winsorized Mean): 극단값을 임계값으로 대체 후 평균 — 데이터를 제거하지 않음 - MAD(Median Absolute Deviation): 중앙값 기준 절대편차의 중앙값 — 강건 산포 측도 변동성 지표 - Variation Ratio(분산도): 1 − (최빈도/전체) — 범주형 자료의 산포 측도 - 거리 상관(Distance Correlation): 비선형 관계까지 포착하는 일반화 상관 — 0이면 독립을 함의 정리·이론 - Gauss-Markov 정리(마르코프 정리): OLS 추정량이 BLUE(Best Linear Unbiased Estimator) — 선형 무편 추정량 중 최소 분산 산포 측도 추가 - 범위(Range): 최댓값 − 최솟값 — 가장 단순한 산포 측도, 이상치에 매우 민감 - 사분위 범위(IQR, Interquartile Range): Q3 − Q1 — 이상치에 강건 - 극값(Extreme Value): 분포의 양 끝 극단값 - 극값 이론(EVT, Extreme Value Theory): 드물게 발생하는 극단 사건의 분포를 모형화 — 금융 리스크·기상 극단 사건 분석 KS 통계량과 차트 - Kolmogorov-Smirnov 통계량(KS Statistic): 두 분포의 누적분포함수 최대 차이 - KS Curve / KS Chart: 모형의 양성·음성 클래스 누적분포의 차이를 시각화 — 모델 변별력 평가 - KS Score: max(cumulativeTPR − cumulativeFPR) — 신용 평가 모델에서 표준 지니계수 (Gini Coefficient) — 소득 분포 - Gini Coefficient(지니계수) / Gini Index: 소득·자산 불평등 측정 지표 (의사결정나무의 Gini Impurity와 다름) - 0 = 완전 평등, 1 = 완전 불평등 - 로렌츠 곡선(Lorenz Curve): 누적 인구 비율 대 누적 소득 비율 곡선 - 지니계수 = 완전 평등선과 로렌츠 곡선 사이 면적의 2배 두 지니의 구분 - Gini Impurity(불순도, ML): 1 − Σpᵢ² — 의사결정나무 분할 기준 - Gini Coefficient(계수, 경제): 로렌츠 곡선 기반 불평등 측정 - 명칭은 같으나 활용 분야가 다름 (둘 다 Corrado Gini가 제안) 자유도 (Degrees of Freedom) 총정리 - 자유도(df): 통계량 계산에서 자유롭게 변할 수 있는 독립적인 값의 수 - 평균에 사용된 후 n−1개만 자유 → 분산 자유도 = n−1 - 카이제곱: df에 따라 분포 모양 결정 - t 분포: df → ∞ 이면 정규분포 - F 분포: 두 카이제곱의 비율 — df₁, df₂ 두 개의 자유도 Pearson 카이제곱 - Pearson 카이제곱 통계량: χ² = Σ(O−E)²/E - Karl Pearson(1857-1936)이 1900년에 제안 - 통계학의 기초가 된 검정 — 적합도·독립성·동질성에 모두 활용 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 표본분산 — Σ(x - x̄)² / (n−1) — 자유도(n−1)를 사용하는 불편추정량 - 표본표준편차 — √s² — 분산의 단위를 원자료와 일치시킨 산포 측도 - 변동계수 — (표준편차 / 평균) × 100 — 단위·평균이 다른 그룹 간 산포 비교 시 사용. 평균이 0에 가까우면 사용 불가 - 기하평균 — ⁿ√(x₁·x₂···xₙ) — 비율·성장률 평균에 사용 - Z-점수 — (x − μ) / σ — 평균에서 몇 표준편차 떨어졌는지. 표준정규분포로 변환 - 백분위수 — 자료를 작은 값부터 정렬 시 p%에 해당하는 위치값. Q1=25%, Q2(중앙값)=50%, Q3=75% - 도수분포표 — 계급별 도수·상대도수·누적도수를 표로 정리 - 줄기-잎 그림 — 줄기(상위 자릿수) + 잎(하위 자릿수)으로 분포 표시 — 원자료 보존 - 극값 이론 — 드물게 발생하는 극단 사건의 분포를 모형화 — 금융 리스크·기상 극단 사건 분석 - KS Curve / KS Chart — 모형의 양성·음성 클래스 누적분포의 차이를 시각화 — 모델 변별력 평가 - 로렌츠 곡선 — 누적 인구 비율 대 누적 소득 비율 곡선 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
통계의 기초 — 척도와 기술통계
과목: 데이터 분석 (3과목, 1번 주제) ·
키워드: 척도 · 기술통계 · 확률분포 · 이상치·결측 · 점추정·구간추정
정의: 통계 분석의 첫걸음은 데이터를 측정하는 척도의 종류를 이해하는 것입니다.
핵심 Q&A (7개)
- 4가지 척도를 낮은 것부터 순서대로 나열하면?
- 명목척도 → 서열척도 → 등간척도 → 비율척도
(위로 갈수록 더 많은 수학 연산 가능) - 등간척도와 비율척도의 차이는?
- 등간척도: 절대 0 없음 (섭씨 온도 0°C는 온도 없음이 아님)
비율척도: 절대 0 있음 (몸무게 0kg = 없음), 비율 의미 있음 - 분산과 표준편차의 차이는?
- 분산: 편차²의 평균 (단위가 원래 데이터의 제곱)
표준편차: 분산의 제곱근 (단위가 원래 데이터와 동일) - 오른쪽 꼬리(양의 왜도) 분포에서 평균·중앙값·최빈값 순서는?
- 최빈값 < 중앙값 < 평균
(평균이 극단값에 가장 민감하게 반응해 오른쪽으로 끌림) - 정규분포의 왜도와 첨도는?
- 왜도(Skewness) = 0 (좌우 대칭)
첨도(Kurtosis) = 3 (또는 초과첨도 = 0) - 모수(Parameter) vs 통계량(Statistic) 차이는?
- 모수: 모집단의 특성값 (μ, σ), 고정된 상수, 보통 미지수
통계량: 표본의 특성값 (x̄, s), 표본마다 변하는 확률변수
통계량으로 모수를 추정 - 좋은 추정량의 4가지 성질은?
- ① 불편성: E(추정량) = 모수
② 효율성: 분산이 가장 작음
③ 일치성: n→∞ 시 모수에 수렴
④ 충분성: 모수의 모든 정보를 담음