데이터마트 정의 데이터마트(Data Mart)는 특정 분석 목적에 맞게 가공·정제된 데이터 집합입니다. 데이터 웨어하우스(전사 통합)와 달리 부서·주제별로 분리된 소규모 데이터 저장소입니다. 구분 데이터마트 데이터 웨어하우스 범위 부서/주제 단위 전사 통합 크기 소규모 (GB) 대규모 (TBPB) 목적 특정 분석 통합 리포팅 데이터 전처리 단계 1. 결측값 처리: 누락 데이터 처리 2. 이상값 처리: 비정상적인 값 탐지 및 처리 3. 정규화/표준화: 변수 스케일 통일 4. 변수 변환: 파생변수 생성, 인코딩 결측값 처리 방법 - 완전 제거(Listwise Deletion): 결측 행 전체 삭제 - 평균/중앙값 대체: 연속형 변수에 평균·중앙값 삽입 - 회귀 대체: 다른 변수로 결측값 예측 - 다중 대체(Multiple Imputation): 여러 번 대체 후 결과 통합 이상값 탐지 - IQR 기준: Q1-1.5×IQR 미만, Q3+1.5×IQR 초과 - Z-score: Z 3이면 이상값 - Boxplot: 수염(whisker) 범위 벗어난 점 정규화 - Min-Max 정규화: (x - min) / (max - min) → [0, 1] 범위 - Z-score 표준화: (x - μ) / σ → 평균 0, 표준편차 1 파생변수: 기존 변수를 조합·변환하여 새롭게 생성한 변수 (예: 나이 → 연령대) EDW(Enterprise Data Warehouse) vs 데이터마트(DM) 구분 EDW DM 범위 전사 통합 (모든 부서/시스템) 부서·주제별 부분 크기 TB PB GB 단위 사용자 경영진, 분석가 특정 부서·팀 구축 장기·고비용 단기·저비용 데이터 모델 정규화/스타 스키마 비정규화/스타 스키마 ETL vs ELT - ETL: 추출(Extract) → 변환(Transform) → 적재(Load), 전통적 DW - ELT: 추출 → 적재 → 변환, 클라우드/빅데이터 환경 DW 스키마 종류 스키마 특징 스타 스키마(Star) 중앙 팩트 테이블 + 비정규화된 차원 테이블 스노우플레이크(Snowflake) 차원 테이블이 정규화되어 분기 팩트 콘스텔레이션 여러 팩트 테이블을 차원으로 연결 데이터 변환 — reshape & JOIN reshape - wide → long(melt): 여러 열을 행으로 펼침 - long → wide(cast/dcast): 행을 열로 모음 - R: reshape2::melt/dcast, tidyr::pivotlonger/pivotwider JOIN 4종 (분석에 자주 사용) JOIN 결과 INNER JOIN 양쪽 모두에 매칭되는 행 LEFT JOIN 왼쪽 테이블 전체 + 오른쪽 매칭 RIGHT JOIN 오른쪽 전체 + 왼쪽 매칭 FULL OUTER JOIN 양쪽 모두 (매칭 + 미매칭) 시험 포인트: EDW는 전사 통합, DM은 부서별. 데이터마트는 EDW의 부분집합으로 볼 수 있음. 결측값 발생 메커니즘 — MCAR/MAR/MNAR 메커니즘 영문 설명 처리 MCAR Missing Completely At Random 결측이 완전 무작위 (다른 변수와 무관) 단순 제거·평균 대체로 충분 MAR Missing At Random 다른 관측된 변수에 의존 (예: 남성이 체중 응답 회피) 회귀 대체, 다중 대체 MNAR Missing Not At Random 결측값 자체에 의존 (예: 고소득자의 소득 미응답) 모델링 어려움, 도메인 전문 지식 시험 포인트: MCAR는 무조건 무작위, MAR는 다른 관측 변수에 의존, MNAR는 결측값 자체에 의존. 머신러닝 기반 이상치 탐지 기법 원리 특징 Isolation Forest 랜덤 분할로 데이터 격리, 평균 분리 깊이 사용 이상치는 적은 분할로 격리됨 LOF (Local Outlier Factor) 지역 밀도 비교 주변보다 밀도 낮으면 이상치 One-Class SVM 정상 데이터 경계 학습 경계 밖 = 이상치 DBSCAN 밀도 기반 군집의 노이즈 군집에 속하지 않는 점이 이상치 Autoencoder 재구성 오차 큰 점 신경망 기반 통계 vs ML 기반 비교 - 통계 기반(Z-score, IQR): 단변량, 정규성 가정 - ML 기반(Isolation Forest, LOF): 다변량, 비선형 패턴 가능 EDA 시각화 차트 종류 차트 용도 데이터 유형 히스토그램(Histogram) 분포 확인 연속형 단변량 박스플롯(Box Plot) 분포·이상치·사분위수 연속형 바이올린 플롯(Violin) 박스플롯 + 분포 모양 연속형 산점도(Scatter Plot) 두 변수 관계 연속형 양변량 히트맵(Heatmap) 상관행렬 시각화 행렬 막대 그래프(Bar) 범주별 빈도/평균 범주형 파이 차트(Pie) 구성 비율 범주형 (5개 이하 권장) 선 그래프(Line) 시계열 추세 시계열 모자이크 플롯(Mosaic) 두 범주형 변수 관계 범주형 양변량 그래프 선택 가이드 - 분포 → 히스토그램, 박스플롯 - 관계 → 산점도, 히트맵 - 비교 → 막대 그래프 - 추세 → 선 그래프 - 구성 → 파이 차트, 누적 막대 시험 포인트: 히스토그램은 연속형 분포, 박스플롯은 사분위수+이상치, 산점도는 두 변수 관계, 히트맵은 상관행렬 시각화. 추가 핵심 개념 — 결측 메커니즘과 SMOTE - 결측 메커니즘 3종(Rubin): - MCAR(Missing Completely At Random): 결측 여부가 어떤 변수와도 무관. 완전 무작위 - MAR(Missing At Random): 결측 여부가 관측된 다른 변수에만 의존 - MNAR(Missing Not At Random): 결측 여부가 결측값 자체에 의존(처리 가장 어려움). 예: 고소득자가 소득 응답 회피 - 다중대치법(Multiple Imputation, MI): 결측값마다 m개(보통 510개)의 대체값을 생성해 m개의 완전 데이터셋을 만들고, 각각 분석한 결과를 Rubin's Rules로 통합. 단일 대치보다 결측의 불확실성을 모형 추정의 분산에 반영. 도구: R mice, Python sklearn IterativeImputer. - 클래스 불균형 해결 — SMOTE·언더·오버샘플링: - 언더샘플링(Undersampling): 다수 클래스 무작위 제거. 정보 손실 위험 - 오버샘플링(Oversampling): 소수 클래스 단순 복제. 과적합 위험 - SMOTE(Synthetic Minority Over-sampling Technique): 소수 클래스 샘플과 k-최근접 이웃 사이를 보간(interpolation)하여 합성 샘플 생성. 단순 복제보다 과적합 위험↓. 변형: Borderline-SMOTE, ADASYN, SMOTE-ENN. 시험 핵심: MCAR·MAR·MNAR의 차이와 SMOTE의 보간 방식이 빈출 포인트입니다. 이상치(Outlier) 처리 - 이상치 탐지 방법: - 통계적: Z-score ( z 3), IQR (Q1−1.5·IQR Q3+1.5·IQR 밖) - 시각적: 박스플롯·산점도 - 모델 기반: Isolation Forest·LOF(Local Outlier Factor) - 이상치 처리: 제거·치환(평균·중앙값)·구간화·Winsorization·로그 변환 - 주의: 진짜 신호일 수도 있으므로 도메인 확인 필수 결측치(Missing Value) 메커니즘 - MCAR(Missing Completely At Random): 완전 무작위 결측 — 통계적 영향 거의 없음 - MAR(Missing At Random): 관찰된 변수에 의존 — 다중대체로 처리 가능 - MNAR(Missing Not At Random): 결측 자체가 결측값에 의존 — 가장 까다로움 - 처리 방법: 삭제·평균/중앙값/최빈값 대체·KNN 대체·다중대체(MICE) 특성 공학 (Feature Engineering) - 파생변수 생성: 기존 변수의 조합·집계·시간 추출 등으로 새 변수 만들기 - 특성 선택(Feature Selection): 정보량이 높은 변수만 선별 — Filter(상관·χ²) / Wrapper(전진·후진) / Embedded(Lasso·Tree importance) - 특성 변환: 표준화·정규화·로그·Box-Cox·Yeo-Johnson - 인코딩: 원-핫·레이블·타깃 인코딩 - 구간화(Binning): 연속형을 구간으로 이산화 (등간격·등빈도) 탐색적 데이터 분석 (EDA) - EDA(Exploratory Data Analysis): Tukey가 제안 — 통계 모델링 전에 데이터의 분포·관계·이상치를 시각·요약으로 탐색 - EDA의 4대 활동: - 저항성(Resistance): 이상치에 강건한 통계량 사용 (중앙값·MAD) - 잔차해석(Residual): 모형 적합 후 잔차로 패턴 확인 - 재표현(Re-expression): 변수 변환(로그·제곱근·역수)으로 정규성·선형성 확보 - 그래프 표현(Display): 박스플롯·히스토그램·산점도 등 변환 종류 - 표준화(Standardization, z-정규화): (x − μ) / σ — 평균 0, 표준편차 1 - Min-Max 정규화: (x − min) / (max − min) — [0, 1] 범위 - 로그 정규화: 오른쪽으로 치우친 분포를 대칭화 결측치 대체 (Imputation) 방법 - 단순 대체: 평균·중앙값·최빈값 — 분산 과소추정 - 회귀 대체(Regression Imputation): 다른 변수로 회귀모형 학습 후 결측 예측 — 결정론적 대체 - 확률적 대체: 회귀 대체에 무작위 잔차 추가 — 분산 보존 - KNN 대체: 가까운 k개 이웃의 값 평균/최빈값으로 대체 - 다중대체(MICE): 여러 대체 데이터셋을 만들어 분석 후 결합 — 분산 추정 보정 - EM 알고리즘: 우도 기반 결측치 추정 데이터 표준화·정제 - Data Standardization(데이터 표준화): 코드·명명·도메인 규칙 표준화 - 데이터 정제(Refinement / Cleansing): 오류·중복·이상치 처리 - 요약 변수(Summary Variable): 그룹별 통계량을 새 변수로 생성 (고객별 평균 구매액 등) 데이터 품질 6대 차원 - 정확성(Accuracy): 실제 값과의 일치 정도 - 완전성(Completeness): 누락 없이 모든 값이 채워짐 - 일관성(Consistency): 동일 데이터가 여러 위치에서 동일하게 표현 - 적시성(Timeliness): 의사결정 시점에 필요한 데이터가 준비됨 - 유효성(Validity): 정의된 형식·범위·도메인 준수 - 유일성(Uniqueness): 중복 없는 단일 표현 - 신선도(Freshness): 최신 데이터로 유지 데이터 모델링 3단계 - 개념적 모델(Conceptual Model): 비즈니스 관점의 ER 다이어그램 - 논리적 모델(Logical Model): 정규화·관계·키 정의 - 물리적 모델(Physical Model): 실제 DBMS 구현 (인덱스·파티션·테이블스페이스) ER 모델 - ER(Entity-Relationship) 모델: 개체·속성·관계로 데이터 구조 표현 - ERD(개체-관계 다이어그램): ER 모델을 시각화한 다이어그램 - 개체(Entity) / 속성(Attribute) / 관계(Relationship): ER의 3대 요소 데이터 누수 (Data Leakage) - 데이터 누수(Data Leakage): 학습 시점에 알 수 없어야 할 정보가 모델에 흘러들어 비현실적으로 높은 성능을 보이는 현상 - 종류: - Look-ahead bias: 미래 정보를 과거에 사용 - 타깃 누수: 타깃 변수와 직접 파생된 특성이 입력에 포함 - 전처리 누수: 전체 데이터로 스케일링·인코딩 후 분할 → 시험 정보가 학습에 유출 - 방지: 데이터를 먼저 분할 → 학습 데이터로만 전처리 파라미터 계산 → 적용 ETL 절차 - 데이터 추출(Extract): 원천 시스템에서 데이터 가져오기 - 데이터 변환(Transform): 정제·표준화·계산 - 데이터 적재(Load): 목적 시스템(DW·DM)에 저장 - ETL vs ELT: 변환 시점의 차이 — ELT는 적재 후 DW에서 변환 (클라우드·빅데이터에 적합) - 변환 규칙(Transformation Rule): 매핑·집계·필터링·조인 규칙 명세 분석 기법 큰 분류 - 통계 기법: 기술/추론 통계 — 평균·분산·검정·회귀 - 머신러닝 기법: 지도/비지도/강화학습 알고리즘 - 딥러닝 기법(DL): 다층 신경망·CNN·RNN·Transformer - 탐색 기법(EDA): 시각화·요약을 통한 패턴 발견 데이터 수명주기 (Data Lifecycle) - 데이터 수명주기 관리(Data Lifecycle Management, DLM): 생성→수집→저장→사용→공유→보관→폐기까지 단계별 정책 적용 - 각 단계에서 보안·품질·접근 권한·보존 기간이 다름 - GDPR·개인정보보호법은 명시적 폐기 의무를 요구 가공의 종류 - 데이터 정제(Cleansing): 오류·중복·결측 처리 - 데이터 변환(Transformation): 형식·단위·스케일 변환 - 데이터 통합(Integration): 다중 소스 결합 - 데이터 축소(Reduction): 차원·표본·도수 축소 - 데이터 이산화(Discretization): 연속 → 범주 - 데이터 표준화(Standardization): 명명·코드·도메인 표준 분산의 분해 - Common Variance(공통 분산): 여러 변수가 공유하는 분산 — 요인분석의 핵심 - Unique Variance(고유 분산): 특정 변수에만 있는 분산 - Specific Variance(특수 분산): 변수 고유의 안정적 분산 - Error Variance(오차 분산): 측정 오차로 인한 분산 - 요인분석: Total = Common + Unique - 공통성(Communality, h²): 변수의 분산 중 공통 요인이 설명하는 비율 재현 가능한 연구 - Reproducible Research(재현가능 연구): 코드·데이터·환경을 함께 제공해 다른 연구자가 같은 결과를 재현할 수 있게 하는 연구 방법 - 핵심 요소: 버전 관리(Git)·환경(Docker·conda)·시드 고정·문서화 추가 스케일링 방법 - Robust Scaler(강건 스케일러): 중앙값과 IQR로 스케일링 - x' = (x − median) / IQR - 이상치에 강건 — 평균·표준편차에 의존하는 StandardScaler·MinMax보다 우수 - 사용: 이상치가 많은 분포·꼬리가 두꺼운 분포 - MaxAbs Scaler: x' = x / max( x ) — 부호 유지·희소 데이터 적합 - Power Transformer: Box-Cox(양수만) / Yeo-Johnson(전체) — 정규성 확보 데이터 큐레이션 - Data Curation(데이터 큐레이션): 데이터의 가치를 높이는 일련의 활동 - 수집·정리·정제·통합·메타데이터 부여·접근성 향상 - 도서관 사서의 역할과 유사 — 데이터 자산화의 핵심 - Data Wrangling / Munging(데이터 정돈): 분석 가능한 형태로 가공 Simple Imputation (단순 대체) - Simple Imputation(단순 대체): 결측치를 평균·중앙값·최빈값으로 일괄 대체 - 장점: 구현 간단, 빠름 - 단점: - 분산 과소추정 - 변수 간 관계 왜곡 - 이상치 영향 (평균 대체 시) - 권장: 결측 비율 5% 미만에만 사용, 비율 높으면 MICE·KNN·EM 대체 권장 메타정보 - 메타정보(Meta-information) / 메타데이터(Metadata): 데이터에 관한 데이터 - 반정형 데이터의 특징: 자기 기술적 메타정보 포함(Self-describing) — JSON·XML - 메타정보가 풍부할수록 데이터 카탈로그·검색·이해가 쉬워짐 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 이상치 탐지 방법 — 통계적: Z-score ( z 3), IQR (Q1−1.5·IQR Q3+1.5·IQR 밖) - 이상치 처리 — 제거·치환(평균·중앙값)·구간화·Winsorization·로그 변환 - 파생변수 생성 — 기존 변수의 조합·집계·시간 추출 등으로 새 변수 만들기 - 특성 선택 — 정보량이 높은 변수만 선별 — Filter(상관·χ²) / Wrapper(전진·후진) / Embedded(Lasso·Tree … - 특성 변환 — 표준화·정규화·로그·Box-Cox·Yeo-Johnson - 구간화 — 연속형을 구간으로 이산화 (등간격·등빈도) - EDA의 4대 활동 — 저항성(Resistance): 이상치에 강건한 통계량 사용 (중앙값·MAD) - 재표현 — 변수 변환(로그·제곱근·역수)으로 정규성·선형성 확보 - 타깃 누수 — 타깃 변수와 직접 파생된 특성이 입력에 포함 - 딥러닝 기법 — 다층 신경망·CNN·RNN·Transformer - Reproducible Research — 코드·데이터·환경을 함께 제공해 다른 연구자가 같은 결과를 재현할 수 있게 하는 연구 방법 - MaxAbs Scaler — x' = x / max( x ) — 부호 유지·희소 데이터 적합 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
데이터마트와 데이터 전처리
과목: 데이터 분석 (3과목, 36번 주제) ·
키워드: 기억 용량 단위 · 빅데이터 · 기술통계 · 시계열 분석 · 인공신경망 · R 프로그래밍 · 데이터 전처리 · 탐색적 분석 · 데이터 마트 · 이상치·결측 · 데이터 웨어하우스 · SQL
정의: 데이터마트 정의 데이터마트(Data Mart)는 특정 분석 목적에 맞게 가공·정제된 데이터 집합입니다.
핵심 Q&A (11개)
- 데이터마트(Data Mart)의 정의는?
- 특정 분석 목적이나 부서에 맞게 가공·정제된 소규모 데이터 집합. 데이터 웨어하우스의 서브셋으로 볼 수 있음
- 결측값 처리 방법 3가지는?
- ① 완전 제거(Listwise Deletion): 결측 행 삭제
② 평균/중앙값 대체: 대표값으로 채움
③ 다중 대체(Multiple Imputation): 여러 번 대체 후 결과 통합 - IQR 기준 이상값 탐지 공식은?
- Q1 - 1.5×IQR 미만이거나 Q3 + 1.5×IQR 초과인 값
(IQR = Q3 - Q1, 사분위수 범위) - Min-Max 정규화 공식은?
- (x - min) / (max - min)
결과값은 0~1 사이로 변환됨. 이상값에 민감하다는 단점 있음 - 파생변수(Derived Variable)란?
- 기존 변수를 조합·변환·계산하여 새롭게 생성한 변수. 예: 나이→연령대, 구매금액/방문횟수→객단가
- EDW vs DM(데이터마트) 차이는?
- EDW: 전사 통합, TB~PB, 경영진/분석가, 장기·고비용
DM: 부서·주제별, GB, 특정 팀, 단기·저비용
DM은 EDW의 부분집합 - JOIN 4종 차이는?
- INNER JOIN: 양쪽 매칭만
LEFT JOIN: 왼쪽 전체 + 매칭
RIGHT JOIN: 오른쪽 전체 + 매칭
FULL OUTER JOIN: 양쪽 전체 - reshape - melt와 cast의 차이는?
- melt (wide → long): 여러 열을 행으로 펼침
cast/dcast (long → wide): 행을 열로 모음
tidyr: pivot_longer / pivot_wider - MCAR / MAR / MNAR 차이는?
- MCAR (완전 무작위): 다른 변수와 무관, 단순 제거 OK
MAR (관측 변수 의존): 다른 관측 변수와 연관, 회귀 대체
MNAR (결측값 의존): 결측값 자체에 의존, 모델링 어려움 - Isolation Forest의 이상치 탐지 원리는?
- 데이터를 랜덤하게 분할하여 격리
이상치는 정상값보다 적은 분할로 격리됨
평균 분리 깊이가 짧을수록 이상치 가능성 높음
다변량·고차원에 적합 - 히스토그램 vs 박스플롯 차이는?
- 히스토그램: 연속형 데이터의 분포 모양 확인 (구간별 빈도)
박스플롯: 사분위수, 중앙값, 이상치 표시 (Q1/Q3, IQR)
바이올린 플롯 = 박스플롯 + 분포 모양