모형 평가 지표

과목: 데이터 분석 (3과목, 13번 주제) ·

키워드: 회귀분석 · 군집분석 · 연관분석 · 모형 평가 · ROC 곡선 · 교차검증 · 부트스트랩 · 이상치·결측 · 표본조사 · 분류 임계값

정의: 분류 모형의 성능을 평가하기 위한 다양한 지표가 있으며, 이를 이해하려면 먼저 오분류표(혼동행렬, Confusion Matrix)를 알아야 합니다.

분류 모형의 성능을 평가하기 위한 다양한 지표가 있으며, 이를 이해하려면 먼저 오분류표(혼동행렬, Confusion Matrix)를 알아야 합니다. 오분류표는 실제값과 예측값의 조합으로 네 가지 결과를 보여줍니다. TP(True Positive)는 실제 참을 참으로 올바르게 예측한 것, FP(False Positive)는 실제 거짓을 참으로 잘못 예측한 것, FN(False Negative)는 실제 참을 거짓으로 잘못 예측한 것, TN(True Negative)는 실제 거짓을 거짓으로 올바르게 예측한 것입니다. 정확도(Accuracy)는 전체 예측 중 올바르게 예측한 비율로, (TP+TN)/(TP+FP+FN+TN)입니다. 정밀도(Precision)는 모델이 참이라고 예측한 것 중 실제로도 참인 비율로, TP/(TP+FP)입니다. 재현율(Recall, 민감도, Sensitivity)은 실제 참인 것 중 모델이 참으로 올바르게 예측한 비율로, TP/(TP+FN)입니다. F1-Score는 정밀도와 재현율의 조화평균으로, F1 = 2×(정밀도×재현율)/(정밀도+재현율) = 2×TP/(2×TP+FP+FN)으로 계산합니다. 정밀도와 재현율이 동시에 높아야 F1이 높으므로, 두 지표의 균형을 평가할 때 사용합니다. 재현율을 더 중요시하면 Fβ-Score(β1), 정밀도를 더 중요시하면 Fβ-Score(β<1)를 사용합니다. 특이도(Specificity)는 실제 거짓인 것 중 모델이 거짓으로 올바르게 예측한 비율로, TN/(FP+TN)입니다. ROC 곡선(Receiver Operating Characteristic Curve)은 X축에 1-특이도(FPR, 거짓 양성률), Y축에 민감도(TPR, 참 양성률)를 놓고 그린 곡선입니다. 곡선이 왼쪽 상단 모서리(0,1)에 가까울수록 좋은 모형이며, AUC(곡선 아래 면적)가 1에 가까울수록 우수한 분류 성능을 의미합니다. 가장 이상적인 점은 (0,1) 좌표, 즉 거짓 양성률이 0이고 참 양성률이 1인 지점입니다. AUC 값 기준으로는 0.9 이상이면 우수, 0.70.9이면 적절, 0.5에 가까울수록 무작위 분류와 유사합니다. "AUC가 클수록 성능이 나쁘다"는 보기가 나오면 반대이므로 틀린 설명입니다. 향상도 곡선(Lift Curve)은 랜덤 모델 대비 분류 모델의 성과 향상 정도를 각 등급별로 나타내는 그래프입니다. 이익도표(Gains Chart)는 분류 모델을 적용했을 때 각 등급에 포함되는 관측치 수를 보여줍니다. 향상도 값이 클수록 해당 등급에서 모델이 랜덤 대비 더 효과적임을 의미합니다. 핵심 요약 & 시험 포인트 혼동행렬(Confusion Matrix) 예측 Positive 예측 Negative -- 실제 Positive TP (참 양성) FN (위음성) 실제 Negative FP (위양성) TN (참 음성) 주요 평가 지표 수식 지표 수식 의미 정확도 (TP+TN)/(TP+FP+FN+TN) 전체 중 올바른 예측 비율 정밀도 TP/(TP+FP) 양성 예측 중 실제 양성 비율 재현율(민감도) TP/(TP+FN) 실제 양성 중 예측 양성 비율 특이도 TN/(FP+TN) 실제 음성 중 예측 음성 비율 F1-Score 2×P×R/(P+R) 정밀도와 재현율의 조화평균 시험 포인트: ROC X축=1-특이도(FPR), Y축=민감도(TPR). AUC가 1에 가까울수록 우수한 모형입니다. 교차검증 (Cross-Validation) 모형의 일반화 성능을 신뢰성 있게 평가하기 위해 데이터를 여러 차례 나눠 검증하는 방법입니다. 방법 설명 장단점 홀드아웃(Holdout) 훈련/테스트를 한 번 분리 (보통 7:3, 8:2) 빠르지만 분할에 따라 편차 큼 k-fold CV 데이터를 k개 폴드로 나눠 k번 반복 안정적, k=5/10이 일반적 LOOCV n개 데이터에 대해 n번 검증 (k=n) 편향↓, 계산 비용↑↑ 층화 k-fold(Stratified) 폴드마다 클래스 비율 유지 불균형 데이터에 필수 부트스트랩(Bootstrap) 복원추출로 훈련 세트 구성, OOB로 검증 OOB ≈ 36.8% 자동 검증 k-fold 절차 1. 데이터를 k개 폴드로 균등 분할 2. 1개 폴드를 테스트, 나머지 k-1개로 학습 3. k번 반복하여 평균 성능 계산 시험 포인트: k-fold에서 k=n이면 LOOCV. 클래스 불균형 시 반드시 층화 k-fold 사용. 부트스트랩의 OOB(Out-of-Bag) ≈ 1-(1-1/n)^n ≈ 36.8%. 추가 평가 지표 PR 곡선 (Precision-Recall Curve) ROC 곡선의 대안. 클래스 불균형 시 ROC보다 적합. 항목 ROC 곡선 PR 곡선 X축 1-특이도 (FPR) 재현율 (Recall) Y축 민감도 (TPR) 정밀도 (Precision) AUC AUROC AUPRC 적합 균형 데이터 불균형 데이터 클래스 불균형(예: 사기 거래 1%)에서는 PR 곡선의 AUPRC가 모형 성능을 더 잘 반영. 추가 분류 지표 지표 수식 특징 Cohen's Kappa (Po - Pe)/(1 - Pe) 우연 일치 보정 정확도 MCC (Matthews CC) (TP·TN-FP·FN)/√... 클래스 불균형에 강건 Log Loss -Σ y log(p) 확률 예측 평가, 작을수록 좋음 추천·검색 평가 지표 지표 의미 MAP (Mean Average Precision) 여러 쿼리의 평균 정밀도 MRR (Mean Reciprocal Rank) 첫 정답의 역순위 평균 (1/rank) NDCG 순위·관련도 가중 평가 Hit Rate@K 상위 K개 중 정답 포함 비율 회귀 모형 평가 지표 수식 특징 MSE Σ(y-ŷ)²/n 평균 제곱 오차 RMSE √MSE 단위가 원래 데이터와 같음 MAE Σ\ y-ŷ\ /n 평균 절대 오차, 이상치에 덜 민감 MAPE Σ\ (y-ŷ)/y\ /n 백분율 오차 R² 1 - SSE/SST 결정계수, 01 시험 포인트: 클래스 불균형에는 PR 곡선/MCC. 추천에는 MAP/MRR/NDCG. 회귀는 RMSE/MAE/R². 추가 핵심 개념 — 편향-분산 트레이드오프와 XAI - 편향-분산 트레이드오프(Bias-Variance Tradeoff): - 총 오차 = Bias² + Variance + Irreducible Error - 편향 高·분산 低 = 과소적합(Underfitting): 모형이 너무 단순. 훈련·테스트 모두 낮음 - 편향 低·분산 高 = 과적합(Overfitting): 훈련 데이터에 과도. 훈련↑ 테스트↓ - 균형 핵심. 모형 복잡도·정규화(L1·L2)·드롭아웃·앙상블로 조정. - 설명가능 AI(XAI, eXplainable AI): - SHAP(SHapley Additive exPlanations): 게임이론의 샤플리값으로 각 변수의 기여도 계산. 전역·국소 해석 가능 - LIME(Local Interpretable Model-agnostic Explanations): 예측 주변의 국소 영역을 단순 모형으로 근사해 개별 예측을 설명 - Partial Dependence Plot(PDP): 한 변수가 변할 때 예측값의 평균 변화 - Feature Importance: 트리 기반 모형에서 변수의 분할 기여도 시험 핵심: Bias-Variance Tradeoff와 과적합·과소적합의 관계, XAI의 SHAP·LIME 차이가 모형 평가 단원의 심화 포인트입니다. 분류 성능 지표 전부 - 정확도(Accuracy): (TP+TN) / 전체 - 정밀도(Precision): TP / (TP+FP) — Positive 예측 중 실제 Positive 비율 - 재현율(Recall) / 민감도(Sensitivity): TP / (TP+FN) — 실제 Positive 중 검출 비율 - 특이도(Specificity): TN / (TN+FP) — 실제 Negative 중 정확히 Negative 예측 비율 - F1-score: 2·Precision·Recall / (Precision+Recall) — 두 지표의 조화평균. 불균형 데이터에 적합 - 거짓 양성/음성(FP/FN): 모델이 양성으로 잘못 예측(FP, Type I) / 음성으로 잘못 예측(FN, Type II) - 분류 임계값(Threshold/Cutoff): 확률 분류기에서 양/음을 가르는 기준. 비용·민감도에 따라 조정 - Kappa 통계량: 우연 일치를 보정한 일치도 지표. 0.6 이상이면 양호 ROC와 AUC - ROC 곡선: x=1−특이도(FPR), y=민감도(TPR). 임계값에 따른 분류기 성능 곡선 - AUC(Area Under Curve): ROC 아래 면적. 1에 가까울수록 우수, 0.5는 무작위 수준 일반화 개념 - 편향(Bias): 모델이 실제 관계를 단순화하여 발생하는 오차 — 과소적합 원인 - 분산(Variance): 학습 데이터 변동에 모델이 민감한 정도 — 과적합 원인 - 편향-분산 트레이드오프: 둘 중 하나를 줄이면 다른 하나가 증가. 총 오차를 최소화하는 균형점 회귀 평가 지표 - MAE(Mean Absolute Error): Σ yᵢ − ŷᵢ / n — 이상치에 강건 - MSE(Mean Squared Error): Σ(yᵢ − ŷᵢ)² / n — 큰 오차에 큰 페널티 - RMSE(Root MSE): √MSE — 원래 단위로 해석 가능 - MAPE(Mean Absolute Percentage Error): 100·Σ yᵢ − ŷᵢ / yᵢ / n — 단위 무관, 0 근처 값에서 불안정 - R²(결정계수): 1 − SSE/SST — 모형이 설명하는 변동 비율 손실함수 (Loss Function) - Cross-entropy(교차엔트로피, Log-loss): 분류 모델의 표준 손실 — −Σ y·log(ŷ) - 이진 교차엔트로피 vs 범주형 교차엔트로피: 출력 차원에 따라 사용 - Hinge Loss: SVM의 손실함수 ROC 곡선의 축 - TPR(True Positive Rate, 진양성률 = 민감도 = Recall): TP / (TP+FN) - FPR(False Positive Rate, 위양성률 = 1−특이도): FP / (FP+TN) - ROC 곡선은 임계값을 변화시키며 (FPR, TPR) 궤적을 그림 이상치 탐지 (Boxplot 기준) - IQR(Interquartile Range): Q3 − Q1 - Lower Fence: Q1 − 1.5·IQR - Upper Fence: Q3 + 1.5·IQR - Mild Outlier(약한 이상치): 1.5·IQR을 벗어남 - Extreme Outlier(극단 이상치): 3·IQR을 벗어남 Garbage In, Garbage Out (GIGO) - 모델 성능은 학습 데이터의 품질에 좌우됨 — 입력이 쓰레기면 출력도 쓰레기 분류 성능 차트 - Lift Chart(이익도표·향상도 차트): 무작위 대비 모델이 얼마나 향상되었는지를 백분위(decile)별로 보여줌 - Cumulative Lift: 상위 X%만 선택했을 때 누적 향상도 - Gain Chart(획득도표): 상위 X%에서 잡아내는 양성 클래스 비율 - Response Chart: 각 decile의 응답률 - 마케팅 캠페인·이탈 예측에서 자원 효율 의사결정에 활용 정밀도-재현율 곡선 - PR Curve(Precision-Recall Curve): x=Recall, y=Precision - PR AUC / Average Precision(AP): PR 곡선 아래 면적 — 불균형 데이터에서 ROC AUC보다 유용 추가 평가 지표 - G-mean(Geometric Mean): √(Sensitivity × Specificity) — 불균형 데이터 - Balanced Accuracy: (Sensitivity + Specificity) / 2 - MCC(Matthews Correlation Coefficient): 혼동행렬 4요소 모두 사용한 균형 지표 [−1, 1] - Brier Score: 예측 확률과 실제값의 MSE — 확률 보정 평가 - Cohen's Kappa: 우연 일치 보정 일치도 Multiclass 평가 평균 방식 - Macro Average: 각 클래스 지표의 단순 평균 - Micro Average: 모든 클래스 합산 후 지표 계산 - Weighted Average: 클래스 빈도로 가중 평균 일반화와 오차 - 일반화(Generalization): 학습 데이터를 넘어 새로운 데이터에서도 잘 동작하는 능력 - 모형의 일반화 능력: 좋은 모델의 핵심 지표 - 일반화 오차(Generalization Error): 모집단 전체에 대한 기대 오차 — 보통 추정 불가 - 경험적 오차(Empirical Error): 학습 데이터에 대한 평균 오차 — 측정 가능 - 시험 오차(Test Error): 시험 데이터의 오차 → 일반화 오차의 근사 검증 방법 - Hold-out validation: 데이터를 한 번만 분할 - Repeated holdout: 여러 번 반복 분할 - K-fold CV: 교차검증 - Out-of-time validation: 시간순으로 분할 — 시계열·금융 - Out-of-sample: 학습에 사용하지 않은 표본 - Backtest(백테스트): 과거 데이터로 미래 예측을 시뮬레이션 예측 정확도 - 예측 정확도(Prediction Accuracy): 실제값과 예측값의 일치 정도 - 분류: Accuracy·Precision·Recall·F1 - 회귀: MAE·RMSE·MAPE 불균형 데이터 핸들링 - ROS(Random Oversampling): 소수 클래스 무작위 복제 - RUS(Random Undersampling): 다수 클래스 무작위 제거 - Class Weight: 손실함수에서 클래스별 가중치 부여 — 데이터 변형 없이 처리 정확도 함정 - Accuracy Paradox(정확도의 함정): 불균형 데이터에서 다수 클래스 예측만으로도 높은 정확도 → 무의미 - 해결: F1·MCC·G-mean 등 균형 지표 사용 학습과 추론 - 학습(Training): 데이터로 모델 파라미터를 찾는 단계 — 시간·자원 많이 소요 - 추론(Inference): 학습된 모델로 새 데이터의 예측을 생성 — 빠르고 가벼움 - 재현성(Reproducibility): 같은 입력·코드·환경에서 같은 결과가 나와야 함 — 시드(seed) 고정·환경 기록·MLflow 모형의 정확도와 비교 - 모형의 정확도(Model Accuracy): 예측이 실제값과 일치하는 정도 — 분류는 Accuracy/F1, 회귀는 RMSE/MAE - 모형 비교: 동일한 검증 데이터에서 평가, 통계적 비교는 McNemar·Friedman·5×2 CV 등 이상치 다변량 확장 - 다변량 이상치(Multivariate Outlier): 개별 변수로는 정상이나 변수 결합에서 비정상 (예: 키 180cm는 정상, 몸무게 30kg도 정상이지만 함께 보면 이상) - 탐지: Mahalanobis 거리·Isolation Forest·다변량 박스플롯 변수 중요도 (Feature Importance) - Tree-based Importance(트리 기반): 노드 분할 시 불순도 감소량 합계 — 트리 모델의 기본 - Permutation Importance(순열 중요도): 검증 셋에서 특정 변수의 값을 무작위로 섞은 후 성능 감소량 — 모델 독립적 - SHAP: 게임이론의 Shapley value를 ML에 적용 — 개별 예측에 대한 변수 기여도 평가의 결과 표현 - Cumulative Capture Rate(누적 포착률): 상위 X%에서 잡아내는 실제 양성 비율 - PR Curve의 해석: PR AUC가 무작위 추측 = 양성 비율 (불균형 데이터에서 자연 기준선) 시계열 모형 평가 - Time Series Split: 시간 순서를 보존한 분할 — 미래 데이터로 학습 방지 - Walk-Forward Validation / Forward Chaining: 학습 윈도우를 시간에 따라 전진시키며 평가 - 학습 1100 → 예측 101110 - 학습 1110 → 예측 111120 - ... 반복 - Expanding Window vs Sliding Window: - Expanding: 학습 데이터를 누적해서 증가 - Sliding: 학습 윈도우 크기 고정, 시작점만 이동 마케팅·분류 평가 곡선 - 향상도 곡선(Lift Curve / Lift Chart): 무작위 대비 모델의 성능 향상 — decile별 lift 표시 - 누적 향상도(Cumulative Lift): 상위 X%만 선택 시 누적 향상도 - 이익 곡선(Profit Curve): 임계값·선택 비율에 따른 기대 이익 - 응답률 곡선(Response Curve): 각 decile의 응답률 — 마케팅 캠페인 ROI 분석 - 분위 분석(Decile Analysis): 데이터를 10분위로 나눠 각 분위의 성능 평가 - CAP Curve(Cumulative Accuracy Profile): 누적 정확도 프로파일 — 무작위·완벽 모델 사이의 면적 비율로 평가 활용 - 신용평가: KS Curve·Lift Chart로 변별력 측정 - 마케팅: Profit Curve로 캠페인 대상 결정 완벽 분류기 지점 - 완벽 분류기(Perfect Classifier): TPR=1, FPR=0 — ROC 곡선의 (0, 1) 좌측 상단 - 무작위 분류기(Random Classifier): 대각선 (FPR=TPR), AUC=0.5 - 최악 분류기: 대각선 아래 (FPRTPR), AUC<0.5 — 라벨 반전하면 좋은 분류기 다중 라벨 평가 - Hamming Loss(해밍 손실): 잘못 예측된 라벨 비율의 평균 - Subset Accuracy(부분집합 정확도): 모든 라벨이 정확히 일치한 비율 — 매우 엄격 - Macro/Micro F1: 클래스별 F1 평균 / 전체 F1 확률 예측 평가 - Brier Score: Σ(ŷᵢ − yᵢ)² / n — 예측 확률과 실제 0/1 차이의 제곱평균 - 0에 가까울수록 좋음 — 확률 보정(Calibration) 평가 - Calibration Curve(보정 곡선): 예측 확률 vs 실제 빈도 — 대각선에 가까울수록 잘 보정됨 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 재현율(Recall) / 민감도(Sensitivity) — TP / (TP+FN) — 실제 Positive 중 검출 비율 - 거짓 양성/음성 — 모델이 양성으로 잘못 예측(FP, Type I) / 음성으로 잘못 예측(FN, Type II) - 분류 임계값 — 확률 분류기에서 양/음을 가르는 기준. 비용·민감도에 따라 조정 - Kappa 통계량 — 우연 일치를 보정한 일치도 지표. 0.6 이상이면 양호 - MAE — Σ yᵢ − ŷᵢ / n — 이상치에 강건 - MAPE — 100·Σ yᵢ − ŷᵢ / yᵢ / n — 단위 무관, 0 근처 값에서 불안정 - Cross-entropy — 분류 모델의 표준 손실 — −Σ y·log(ŷ) - Lift Chart — 무작위 대비 모델이 얼마나 향상되었는지를 백분위(decile)별로 보여줌 - Cumulative Lift — 상위 X%만 선택했을 때 누적 향상도 - Gain Chart — 상위 X%에서 잡아내는 양성 클래스 비율 - PR AUC / Average Precision — PR 곡선 아래 면적 — 불균형 데이터에서 ROC AUC보다 유용 - G-mean — √(Sensitivity × Specificity) — 불균형 데이터 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (11개)

혼동행렬(Confusion Matrix)의 4가지 셀은?
TP: 실제 참 → 참 예측 (정답)
FP: 실제 거짓 → 참 예측 (오류)
FN: 실제 참 → 거짓 예측 (오류)
TN: 실제 거짓 → 거짓 예측 (정답)
정밀도 vs 재현율의 수식 차이는?
정밀도(Precision): TP/(TP+FP) — 양성 예측 중 실제 양성
재현율(Recall): TP/(TP+FN) — 실제 양성 중 예측 양성
특이도(Specificity)의 수식은?
TN/(TN+FP) — 실제 음성 중 음성으로 올바르게 예측한 비율
ROC 곡선의 X축과 Y축은?
X축: 1-특이도 (FPR, 거짓 양성률)
Y축: 민감도/재현율 (TPR, 참 양성률)
AUC가 1에 가까울수록 우수
F1-Score가 낮을 때의 의미는?
정밀도와 재현율 중 하나 이상이 낮다는 뜻
F1 = 2×P×R/(P+R) — 두 지표의 조화평균
재현율 중시 시 Fβ(β>1) 사용
홀드아웃 vs k-fold 교차검증의 차이는?
홀드아웃: 한 번만 분리(7:3 등), 빠르지만 분할 편차 큼
k-fold: k번 반복(보통 5/10), 안정적이지만 계산량↑
k=n이면 LOOCV
층화 k-fold(Stratified k-fold)를 언제 사용하나?
클래스 분포가 불균형한 데이터(예: 사기 거래 1%, 정상 99%)에서
각 폴드가 원본 클래스 비율을 유지하도록 분할
→ 분류 모형 평가의 신뢰도 향상
부트스트랩의 OOB 비율은? 왜?
약 36.8% (= e⁻¹)
복원추출로 n번 뽑을 때 한 번도 선택되지 않을 확률 = (1-1/n)^n → 1/e
이 OOB 데이터로 별도 검증 세트 없이 평가 가능
ROC 곡선 vs PR 곡선 — 언제 어느 것을 쓰나?
ROC: X=1-특이도, Y=민감도, 균형 데이터에 적합
PR: X=재현율, Y=정밀도, 클래스 불균형에 적합
AUPRC가 AUROC보다 불균형 모형을 더 잘 평가
추천·검색 평가 지표 MAP, MRR, NDCG는?
MAP: 여러 쿼리의 평균 정밀도
MRR: 첫 정답의 역순위 평균 (1/rank)
NDCG: 순위와 관련도를 가중하여 평가
Hit Rate@K: 상위 K개 중 정답 포함 비율
회귀 모형 평가 — RMSE vs MAE 차이는?
RMSE = √(Σ(y-ŷ)²/n): 큰 오차에 더 민감 (제곱하므로)
MAE = Σ|y-ŷ|/n: 모든 오차에 동일 가중치, 이상치에 덜 민감
해석은 RMSE/MAE 모두 원본 단위

이 주제의 관련 기출 퀴즈 풀기 »