분석 방법론은 데이터 분석 프로젝트를 체계적으로 수행하기 위한 절차와 방법을 정한 것입니다. 폭포수(Waterfall) 모형은 가장 고전적이고 전통적인 개발 모형으로, 요구분석→설계→구현→테스트→유지보수를 한 방향으로 순차적으로 진행합니다. 각 단계가 완료된 후 다음 단계로 넘어가며, 문제가 발생하면 이전 단계로 피드백하여 수정합니다. 나선형(Spiral) 모형은 계획 수립→위험 분석→개발 및 검증→고객 평가의 네 단계를 반복하며 점진적으로 시스템을 완성하는 방법입니다. 위험 분석을 중요시하며 유지보수가 필요 없다는 장점이 있지만, 효과적인 관리 체계가 없으면 복잡도가 급격히 상승할 수 있습니다. 프로토타입(Prototype) 모형은 사용자의 요구사항이 불분명할 때 먼저 시제품을 만들어 결과를 예측하고, 그 결과를 바탕으로 반복적으로 개선하는 상향식 접근법입니다. KDD(Knowledge Discovery in Database)는 데이터베이스에서 유용한 지식을 발견하는 과정으로, 데이터셋 선택→데이터 전처리(노이즈, 이상값, 결측치 제거)→데이터 변환(차원 축소)→데이터마이닝→해석 및 평가의 순서로 진행됩니다. CRISP-DM(Cross Industry Standard Process for Data Mining)은 산업 표준 데이터마이닝 방법론으로, 업무 이해→데이터 이해→데이터 준비→모델링→평가→전개의 6단계로 구성됩니다. 시험에서는 첫 번째 단계가 반드시 "업무 이해"라는 점을 기억해야 하며, "데이터 이해"나 "데이터 준비"가 먼저 오는 보기는 틀립니다. CRISP-DM은 순환적(Iterative) 구조로, 전개(Deployment) 단계 이후에도 새로운 비즈니스 요구나 데이터 변화에 따라 다시 업무 이해 단계로 되돌아가 반복 개선할 수 있습니다. SEMMA(Sample→Explore→Modify→Model→Assess)는 SAS Institute에서 개발한 데이터마이닝 방법론으로, 5단계로 구성됩니다. Sample(표본추출)은 분석 가능한 크기의 데이터 표본을 추출하는 단계입니다. Explore(탐색)은 시각화와 기술통계로 데이터의 특성과 이상값을 파악하는 단계입니다. Modify(수정)은 변수 변환, 결측치 처리, 파생 변수 생성 등 데이터를 정제하는 단계입니다. Model(모델링)은 예측·분류 모델을 구축하는 단계입니다. Assess(평가)는 모델 성능을 평가하고 검증하는 단계입니다. SEMMA는 SAS 분석 도구에 특화된 방법론으로, KDD·CRISP-DM과 함께 3대 데이터마이닝 방법론으로 시험에 출제됩니다. 핵심 요약 & 시험 포인트 데이터마이닝 3대 방법론 비교 방법론 개발 단계 KDD 학술 분야 선택→전처리→변환→마이닝→해석/평가 (5단계) CRISP-DM 산업 표준 업무이해→데이터이해→데이터준비→모델링→평가→전개 (6단계) SEMMA SAS Institute Sample→Explore→Modify→Model→Assess (5단계) 시험 포인트: CRISP-DM 첫 번째 단계는 반드시 "업무 이해" 입니다. KDD는 "데이터셋 선택"으로 시작합니다. SEMMA는 "표본추출(Sample)"로 시작합니다. 추가 포인트: CRISP-DM은 6단계가 순환적(Iterative)으로 운영됩니다. 전개 후에도 업무 이해 단계로 되돌아갈 수 있습니다 — 이 점이 KDD(선형 절차)와의 차이점입니다. 분석 방법론의 구성 - 방법론의 구성: 단계(Phase) 태스크(Task) 스텝(Step) 계층 구조 - 단계별 산출물: 각 단계 종료 시 산출되는 문서·모델·결정 사항 - 반복적 모형(Iterative): 단계를 반복하며 점진적으로 완성 — 애자일과 유사 Box-Jenkins 절차 (ARIMA 모형 구축) - Box-Jenkins: ARIMA 모형 식별·추정·진단의 반복 절차 - 모형 식별(Identification): ACF·PACF로 (p, d, q) 결정 - 모형 추정(Estimation): MLE로 계수 추정 - 모형 진단(Diagnostic): 잔차의 백색잡음 여부 확인 — Ljung-Box·Phillips-Perron 린 스타트업 (Lean Startup) - 린 스타트업(Lean Startup): 에릭 리스(Eric Ries)가 제안한 빠른 검증·반복의 스타트업 방법론 - 핵심 사이클: Build → Measure → Learn(구축 → 측정 → 학습) 반복 - MVP(Minimum Viable Product, 최소 기능 제품): 핵심 기능만 갖춘 시제품으로 빠른 시장 검증 - 검증된 학습(Validated Learning): 가설을 데이터로 검증하며 학습 - 피봇(Pivot): 학습 결과 가설이 틀렸다면 방향 전환 - 빅데이터 분석 프로젝트에도 자주 적용 — PoC → MVP → 본격 배포 순서 애자일 vs 린 비교 - 애자일: 작은 사이클로 반복적 개발 (SW 개발 중심) - 린: 가설-검증 사이클로 학습 가속 (제품·비즈니스 모델 검증 중심) - 두 방법론은 서로 보완적 — 자주 결합되어 사용 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 방법론의 구성 — 단계(Phase) 태스크(Task) 스텝(Step) 계층 구조 - 단계별 산출물 — 각 단계 종료 시 산출되는 문서·모델·결정 사항 - 반복적 모형 — 단계를 반복하며 점진적으로 완성 — 애자일과 유사 - Box-Jenkins — ARIMA 모형 식별·추정·진단의 반복 절차 - 모형 진단 — 잔차의 백색잡음 여부 확인 — Ljung-Box·Phillips-Perron - 린 스타트업 — 에릭 리스(Eric Ries)가 제안한 빠른 검증·반복의 스타트업 방법론 - MVP — 핵심 기능만 갖춘 시제품으로 빠른 시장 검증 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
분석 방법론 — 폭포수·나선형·프로토타입·KDD·CRISP-DM
과목: 데이터 분석 기획 (2과목, 4번 주제) ·
키워드: 데이터베이스 · 분석 주제 유형 · 하향식·상향식 접근 · 분석 방법론 · KDD · CRISP-DM · SEMMA · 폭포수 모델 · 나선형 모델 · 프로토타입 · 기술통계 · 표본추출 · 군집분석 · 차원 축소 · 데이터 전처리 · 데이터 마이닝 · 데이터 마트 · 이상치·결측 · MLOps·최신 ML
정의: 분석 방법론은 데이터 분석 프로젝트를 체계적으로 수행하기 위한 절차와 방법을 정한 것입니다.
핵심 Q&A (5개)
- CRISP-DM 6단계는?
- ① 비즈니스 이해 → ② 데이터 이해 → ③ 데이터 준비
→ ④ 모델링 → ⑤ 평가 → ⑥ 전개(배포)
(순환·반복 구조) - KDD 프로세스 5단계는?
- ① 데이터 선택 → ② 전처리 → ③ 변환
→ ④ 데이터 마이닝 → ⑤ 해석/평가 - SEMMA 방법론이란?
- SAS Institute 개발. Sample → Explore → Modify → Model → Assess
(샘플링→탐색→변형→모델링→평가) - CRISP-DM에서 전개(배포) 후 어디로 돌아가나?
- 비즈니스 이해 단계로 돌아간다 (순환·반복 구조)
분석은 1회로 끝나지 않고 지속적으로 개선된다 - 폭포수 모델 vs 나선형 모델의 차이는?
- 폭포수: 순차적, 이전 단계로 돌아가기 어려움
나선형: 반복적, 위험 분석 포함, 프로토타입 활용