데이터 마이닝 개요

과목: 데이터 분석 (3과목, 14번 주제) ·

키워드: 데이터베이스 · 분석 주제 유형 · 분석 방법론 · KDD · CRISP-DM · SEMMA · 회귀분석 · 로지스틱 회귀 · 시계열 분석 · 의사결정나무 · 인공신경망 · 군집분석 · 연관분석 · 차원 축소 · 과적합 · 데이터 전처리 · 탐색적 분석 · 데이터 마이닝 · 데이터 마트 · 이상치·결측 · MLOps·최신 ML

정의: 데이터 마이닝 정의 데이터 마이닝(Data Mining)은 대규모 데이터에서 통계·기계학습 기법을 활용하여 유용한 패턴과 지식을 자동으로 발견하는 과정입니다.

데이터 마이닝 정의 데이터 마이닝(Data Mining)은 대규모 데이터에서 통계·기계학습 기법을 활용하여 유용한 패턴과 지식을 자동으로 발견하는 과정입니다. KDD 프로세스 (Knowledge Discovery in Databases) 대용량 데이터베이스에서 지식을 발견하는 5단계 프로세스입니다. 단계 명칭 설명 1 데이터 선택 (Selection) 분석 목적에 맞는 데이터 추출 2 전처리 (Preprocessing) 결측치 처리, 이상값 제거, 노이즈 정제 3 변환 (Transformation) 정규화, 차원 축소, 특징 추출 4 데이터 마이닝 (Data Mining) 알고리즘 적용, 패턴·규칙 탐색 5 해석 및 평가 (Interpretation/Evaluation) 발견된 패턴의 의미 해석 및 유용성 평가 CRISP-DM 방법론 (6단계) 산업 표준 데이터 마이닝 방법론입니다. 1. 비즈니스 이해 (Business Understanding): 목표 정의 2. 데이터 이해 (Data Understanding): 데이터 탐색 3. 데이터 준비 (Data Preparation): 전처리·변환 4. 모델링 (Modeling): 알고리즘 적용 5. 평가 (Evaluation): 비즈니스 목표 부합 여부 검토 6. 배포 (Deployment): 실제 환경 적용 SEMMA 방법론 (SAS) SAS Institute가 개발한 5단계 방법론입니다. 단계 설명 Sample 대표 샘플 추출 Explore 탐색적 분석, 패턴 파악 Modify 변수 변환, 파생변수 생성 Model 모델 적합 Assess 모델 성능 평가 데이터 마이닝 주요 기법 분류 기법 분류 (Classification) 의사결정나무, 로지스틱 회귀, 신경망, SVM 군집 (Clustering) K-means, 계층적 군집 연관 (Association) 아프리오리(Apriori) 알고리즘 예측 (Prediction) 회귀분석, 시계열 분석 데이터 분리 및 과적합 - 훈련/검증/테스트 비율: 7:3 또는 6:2:2 - 과적합(Overfitting): 훈련 데이터에 과도하게 맞춰 새 데이터에 일반화 실패 - 과소적합(Underfitting): 모델이 너무 단순하여 훈련 데이터도 제대로 학습하지 못함 시험 핵심: KDD 5단계(선택→전처리→변환→마이닝→해석), CRISP-DM 6단계, SEMMA 5단계의 순서와 각 방법론 간 비교가 자주 출제됩니다. 대표 활용 분야 - 이탈 예측(Churn Prediction): 통신·구독 서비스에서 고객 이탈 가능성 예측 → 선제적 retention 마케팅 - 이상거래 탐지(FDS, Fraud Detection System): 결제·보험 사기·계좌 이상 패턴 식별 — 불균형 데이터·실시간성 핵심 - 추천 시스템(Recommendation): 협업 필터링(사용자/아이템 기반), 콘텐츠 기반, 하이브리드 - 고객 세분화: RFM(Recency·Frequency·Monetary), 군집분석 활용 - CLV/LTV(Customer Lifetime Value): 고객 생애가치 예측 — 마케팅 ROI 산정 핵심 데이터마이닝 절차 (5단계) 1. 목적 설정(Business Understanding): 비즈니스 문제 정의·분석 목표 설정 2. 데이터 준비: 데이터 수집·정제·통합 3. 데이터 가공(전처리): 결측·이상치·변환·특성 생성 4. 데이터 마이닝 기법 적용(Modeling): 분류·군집·연관·예측 모델 학습 5. 검증(Evaluation): 성능 평가·해석·배포 SEMMA 방법론 (SAS) - Sample: 표본 추출 - Explore: 탐색 - Modify: 변환·가공 - Model: 모델링 - Assess: 평가 KDD vs CRISP-DM vs SEMMA - KDD: Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation - CRISP-DM: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment - SEMMA: 위 5단계 - 공통점: 반복적·비즈니스 목적 중심 차원의 저주 (Curse of Dimensionality) - 변수(차원)가 늘어날수록 데이터 간 거리가 비슷해지고 표본 밀도가 급격히 감소 - 해결: 차원축소(PCA·LDA·t-SNE)·특성 선택·정규화 데이터마이닝 모형 분류 - 분류 모형(Classification): 범주형 종속변수 예측 (Y/N, 등급) - 예측 모형(Predictive Model): 연속형 종속변수 예측 (회귀·시계열) - 기술 모형(Descriptive Model): 군집·연관·패턴 발견 — 종속변수 없음 - 동일 알고리즘이 분류와 회귀 양쪽 모두에 쓰일 수 있음 (예: 의사결정나무, 신경망) 표준 방법론 풀네임 - CRISP-DM: Cross-Industry Standard Process for Data Mining - DMBOK: Data Management Body of Knowledge GIGO 원칙 - Garbage In, Garbage Out: 데이터 품질이 모델 품질을 결정 — 전처리·정제가 모델링 못지않게 중요 데이터 마이닝 모형 분류 - 데이터 마이닝 모형(Model): 알고리즘이 학습 후 만들어내는 패턴·예측 함수 - 모형 분류: - 분류(Classification): 범주형 종속변수 - 추정(Estimation): 연속형 종속변수 — 회귀 - 예측(Prediction): 미래값 — 시계열·회귀 - 연관(Association): 항목 간 규칙 - 군집(Clustering): 라벨 없이 그룹화 - 기술(Description): 데이터 특성 요약 측정의 신뢰성·타당성 - 신뢰성(Reliability): 측정 결과의 일관성 — 같은 조건에서 같은 결과 - 타당성(Validity): 측정하고자 하는 것을 정확히 측정하는지 - Cronbach's α: 내적 일관성 신뢰도 지표 (≥ 0.7 권장) 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 이상거래 탐지 — 결제·보험 사기·계좌 이상 패턴 식별 — 불균형 데이터·실시간성 핵심 - 추천 시스템 — 협업 필터링(사용자/아이템 기반), 콘텐츠 기반, 하이브리드 - 고객 세분화 — RFM(Recency·Frequency·Monetary), 군집분석 활용 - CLV/LTV — 고객 생애가치 예측 — 마케팅 ROI 산정 핵심 - 예측 모형 — 연속형 종속변수 예측 (회귀·시계열) - 기술 모형 — 군집·연관·패턴 발견 — 종속변수 없음 - DMBOK — Data Management Body of Knowledge - Garbage In, Garbage Out — 데이터 품질이 모델 품질을 결정 — 전처리·정제가 모델링 못지않게 중요 - 모형 분류 — 분류(Classification): 범주형 종속변수 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (7개)

KDD 프로세스의 5단계 순서는?
① 데이터 선택(Selection) → ② 전처리(Preprocessing) → ③ 변환(Transformation) → ④ 데이터 마이닝(Data Mining) → ⑤ 해석 및 평가(Interpretation/Evaluation)
CRISP-DM 6단계 순서는?
① 비즈니스 이해 → ② 데이터 이해 → ③ 데이터 준비 → ④ 모델링 → ⑤ 평가 → ⑥ 배포
(산업 표준 데이터 마이닝 방법론)
SEMMA 방법론의 5단계는?
Sample(샘플 추출) → Explore(탐색) → Modify(변환) → Model(모델링) → Assess(평가)
SAS Institute가 개발한 방법론
KDD vs CRISP-DM vs SEMMA 비교 — 단계 수와 개발 주체는?
KDD: 5단계, 학술적 지식 발견 프로세스
CRISP-DM: 6단계, 산업 표준 (배포 단계 포함)
SEMMA: 5단계, SAS Institute 개발
데이터 마이닝 기법 4가지 분류와 대표 알고리즘은?
분류(Classification): 의사결정나무, SVM, 신경망
군집(Clustering): K-means, 계층적 군집
연관(Association): 아프리오리(Apriori)
예측(Prediction): 회귀분석, 시계열
과적합(Overfitting)과 과소적합(Underfitting)의 차이는?
과적합: 모델이 훈련 데이터에 과도하게 특화되어 새 데이터에서 성능 저하 (분산 높음)
과소적합: 모델이 너무 단순하여 훈련 데이터조차 잘 학습하지 못함 (편향 높음)
훈련·검증·테스트 데이터의 일반적인 분리 비율은?
7:3 (훈련:테스트) 또는 6:2:2 (훈련:검증:테스트). 검증 데이터는 하이퍼파라미터 튜닝에, 테스트 데이터는 최종 성능 평가에 사용

이 주제의 관련 기출 퀴즈 풀기 »