군집분석

과목: 데이터 분석 (3과목, 10번 주제) ·

키워드: 기술통계 · 인공신경망 · 군집분석 · 차원 축소 · 변수 선택 · 판별분석 · 텍스트 마이닝 · 거리 측정 · 이상치·결측 · 데이터 기반 의사결정 · 강화학습·지도학습

정의: 군집분석은 유사한 특성을 가진 데이터들을 자동으로 그룹(군집)으로 묶는 비지도학습 방법입니다.

군집분석은 유사한 특성을 가진 데이터들을 자동으로 그룹(군집)으로 묶는 비지도학습 방법입니다. 분류분석과 달리 미리 정해진 그룹이 없는 상태에서 데이터 자체의 패턴을 기반으로 그룹을 형성합니다. K-Means는 가장 대표적인 비계층적 군집분석 기법입니다. K-Means는 이상치(Outlier)에 민감하다는 단점이 있습니다. 이를 보완한 K-medoids(PAM, Partitioning Around Medoids)는 중심점으로 평균 대신 실제 데이터 포인트(대표 개체)를 사용하므로 이상치에 강합니다. 먼저 무작위로 K개의 초기 중심점을 설정한 후, 각 데이터를 가장 가까운 중심점에 할당하고, 각 군집의 중심점을 재계산하는 과정을 수렴할 때까지 반복합니다. 시험에서 "군집 개수 K를 알고리즘이 자동으로 선택한다"는 보기가 나오면 틀린 것입니다. K는 사용자가 미리 지정해야 합니다. 또한 "초기 중심값 설정은 결과에 영향을 주지 않는다"도 틀린 설명입니다. 최적 K를 결정하는 방법으로는 엘보우 방법(Elbow Method)과 실루엣 계수(Silhouette Coefficient)가 있습니다. 엘보우 방법은 K 값에 따른 군집 내 제곱합(WSS, Within-cluster Sum of Squares)을 그래프로 그려서 감소 기울기가 급격히 완만해지는 꺾이는 지점(Elbow Point)을 최적 K로 선택합니다. 실루엣 계수는 -1에서 1 사이의 값으로, 군집 내 응집도와 군집 간 분리도를 종합하여 군집 품질을 평가합니다. 값이 1에 가까울수록 이상적인 군집화이며, 0에 가까우면 군집 경계에 위치하고, 음수이면 잘못 분류된 것입니다. 계층적 군집분석은 데이터를 단계적으로 합치거나 나누면서 계층적 구조(덴드로그램)를 형성합니다. 군집 간 거리 측정 방법으로 단일연결법(최단 거리), 최장연결법(최대 거리), 평균연결법(평균 거리), 와드연결법(군집 내 오차제곱합 SSE를 최소화)이 있습니다. DBSCAN은 밀도 기반 군집화 방식으로 군집 개수를 미리 정할 필요가 없으며, 초기 중심값도 불필요합니다. SOM(자기조직화지도)은 경쟁학습 기반 신경망으로 차원 축소와 군집화를 동시에 수행합니다. 유사도(거리) 측정에는 유클리디안 거리, 맨하탄 거리, 마할라노비스 거리(변수 간 상관관계를 고려), 자카드 거리(범주형 데이터 간 유사도) 등이 사용됩니다. 자카드 거리는 연속형이 아닌 범주형 데이터에 적합하므로, "연속형 변수 간 거리 측정 방법"으로는 부적절합니다. 핵심 요약 & 시험 포인트 군집분석 기법 비교 기법 유형 K 사전지정 특징 K-Means 비계층적 필요 구형 군집, 초기 중심값에 민감 계층적 군집 계층적 불필요 덴드로그램 시각화, 와드연결법(SSE 최소화) DBSCAN 밀도 기반 불필요 비구형 군집, 이상치 탐지 SOM 신경망 필요 차원 축소 + 군집화 동시 수행 최적 K 결정 방법 방법 설명 엘보우(Elbow) WSS 그래프에서 기울기가 급격히 완만해지는 지점 실루엣 계수 -11 범위, 1에 가까울수록 이상적 군집화 시험 포인트: K-Means는 K를 분석가가 사전 지정해야 합니다. DBSCAN은 K 지정이 불필요합니다. 유사도·거리 측정법 종합 정리 연속형 변수 거리 측정법 수식 특징 유클리드(Euclidean) √Σ(xᵢ-yᵢ)² 가장 일반적, 직선 거리 맨해튼(Manhattan) Σ\ xᵢ-yᵢ\ L1 거리, 격자 거리 민코프스키(Minkowski) (Σ\ xᵢ-yᵢ\ ^p)^(1/p) 일반화 거리 (p=1: 맨해튼, p=2: 유클리드) 체비셰프(Chebyshev) max\ xᵢ-yᵢ\ 민코프스키 p→∞, 체스의 킹 마할라노비스(Mahalanobis) 변수 간 공분산 고려 변수 상관·스케일 보정 범주형/특수 데이터 거리 측정법 수식 사용처 자카드(Jaccard) \ A∩B\ /\ A∪B\ 집합·이진 데이터 (0과 1) 코사인 유사도(Cosine) A·B / (\ A\ ·\ B\ ) 텍스트 (TF-IDF), 고차원 벡터 편집 거리(Levenshtein) 삽입·삭제·교체 횟수 문자열 비교 해밍(Hamming) 다른 위치의 수 동일 길이 이진 문자열 거리 vs 유사도 - 거리(Distance): 작을수록 가까움 (0=동일) - 유사도(Similarity): 클수록 가까움 (1=동일) - 코사인은 유사도(1=동일 방향), 코사인 거리 = 1 - 코사인 유사도 시험 포인트: 텍스트 → 코사인, 이진/집합 → 자카드, 변수 상관 고려 → 마할라노비스, 격자 → 맨해튼. 추가 핵심 개념 — GMM·EM 알고리즘과 군집 변형 - GMM(Gaussian Mixture Model): 데이터가 여러 가우시안 분포의 혼합에서 생성됐다고 가정해 각 데이터가 어느 분포에 속할 확률을 추정하는 확률적 군집 기법. K-means보다 유연(타원형 군집 가능). - EM 알고리즘(Expectation-Maximization): 잠재변수가 있는 모형의 최대가능도(MLE) 추정 반복 알고리즘. - E-step: 현재 파라미터로 잠재변수의 사후확률·기대값 계산 - M-step: 그 기대값을 최대화하는 파라미터 재추정 - GMM·HMM·결측치 추정에 활용. 국소 최적해·초기값 민감 - K-medoids(PAM, Partitioning Around Medoids): K-means에서 평균(mean) 대신 실제 데이터 포인트(medoid)를 중심으로 사용. 이상치에 강건. 계산 비용 O(k(n−k)²)로 대용량에는 부적합. 대용량 변형: CLARA, CLARANS. - DBSCAN(Density-Based Spatial Clustering): 밀도 기반 군집화. 군집 수 사전 지정 불필요, 비구형 군집 탐지·노이즈 자동 식별. 파라미터: ε(반경), minPts(핵심점 최소 이웃 수). 시험 핵심: K-means(평균·이상치 민감)·K-medoids(이상치 강건)·DBSCAN(밀도·노이즈 자동)·GMM(확률·EM)의 차이가 군집 단원의 빈출 출제입니다. 계층적 군집화 연결법 - 단일/최단 연결법(Single Linkage): 두 군집의 가장 가까운 두 점 거리. 사슬효과(chaining) - 완전/최장 연결법(Complete Linkage): 두 군집의 가장 먼 두 점 거리. 작고 조밀한 군집 생성 - 평균 연결법(Average Linkage): 두 군집의 모든 쌍 평균 거리 - 중심 연결법(Centroid): 두 군집 중심 간 거리 - Ward 연결법: 군집 내 분산 증가량이 최소가 되도록 병합 — 균형 잡힌 군집 형성 비계층적 군집화 추가 - DBSCAN(Density-Based): 밀도 기반. eps(이웃 반경)·minPts 파라미터로 잡음(noise) 자동 식별. 군집 수 사전 지정 불필요 - EM 알고리즘 / GMM(Gaussian Mixture Model): 데이터가 여러 정규분포의 혼합이라 가정 — 소프트 군집(확률적 소속) 군집 평가 지표 - 실루엣 계수(Silhouette): (b−a)/max(a,b). [−1, 1] 범위, 1에 가까울수록 잘 군집화 - Davies-Bouldin Index: 군집 내 산포 / 군집 간 거리 — 작을수록 좋음 - Calinski-Harabasz Index: 군집 간 분산 / 군집 내 분산 — 클수록 좋음 - 엘보우(Elbow) / 팔꿈치 기법: WCSS(군집 내 제곱합)를 k에 따라 그려 꺾이는 지점 선택 k-평균 군집 (K-means) - K-means: 군집 중심을 무작위로 초기화 → 가까운 점 할당 → 중심 재계산 반복 - 수렴 조건: 할당 변화 없거나 중심 변화 임계값 이하 - 단점: 초기값 민감, 군집 수 k 사전 지정, 구형 군집 가정 - k 결정: 엘보우·실루엣·Gap statistic - K-medoids / PAM: 중심을 실제 데이터 점으로 사용 — 이상치에 강건 계층적 군집 시각화 - 덴드로그램(Dendrogram): 계층적 군집 결과를 트리로 시각화. 자르는 높이가 군집 수 결정 - 계층적 vs 비계층적: 사전 군집 수 불필요 vs 필요 거리(Distance) 측도 - 유클리드 거리: √Σ(xᵢ−yᵢ)² — 가장 보편 - 맨해튼 거리: Σ xᵢ−yᵢ — 격자 거리 - 민코프스키 거리(Minkowski): (Σ xᵢ−yᵢ ᵖ)^(1/p) — p=1 맨해튼, p=2 유클리드의 일반화 - 마할라노비스 거리(Mahalanobis): 공분산을 반영한 거리 — 변수 간 상관성 보정 - 체비셰프 거리: max xᵢ−yᵢ — 가장 큰 차원 차이 계층적 군집 방향성 - 응집형(Agglomerative): Bottom-up — 각 점을 개별 군집으로 시작해 가까운 군집끼리 병합. 가장 일반적 - 분리형(Divisive): Top-down — 전체를 하나의 군집으로 시작해 분할 - Hierarchical Clustering: 응집형·분리형의 총칭 단일연결법의 사슬효과 - 사슬효과(Chaining Effect): Single Linkage가 점들을 사슬처럼 연결해 길고 가는 군집을 만드는 현상 — Complete·Ward로 완화 DBSCAN 구성요소 - Core Point(핵심점): eps 반경 내 minPts 이상의 점을 가진 점 - Border Point(경계점): 핵심점은 아니지만 핵심점의 이웃 - Noise / Outlier Point: 핵심점·경계점 어디에도 속하지 않는 점 최적 k 결정 - Gap Statistic: 실제 데이터의 WCSS와 무작위 균등 분포 데이터의 WCSS 차이로 최적 k 선택 — 엘보우보다 객관적 혼합형 데이터 군집 - K-prototype: 수치형 + 범주형 데이터 동시 처리 — K-means(수치) + K-modes(범주) 결합 - K-modes: 범주형 데이터 전용 K-means - Fuzzy C-means(퍼지 군집): 한 점이 여러 군집에 부분 소속 (Soft Clustering) - Hard / Soft Clustering: 단일 소속 vs 확률·정도 소속 - Crisp Clustering: Hard Clustering의 동의어 추가 거리 측도 - 표준화 거리(Standardized Distance): 변수마다 다른 단위를 표준화 후 계산 - Gower 거리: 수치형·범주형 혼합 데이터의 거리 - Hamming 거리: 같은 길이의 두 문자열의 차이 자릿수 — 범주형·이진 변수 - 코사인 거리: 1 − 코사인 유사도 군집화 분산 분해 - TSS(Total Sum of Squares): 전체 분산 = Σ‖xᵢ − x̄‖² - WCSS(Within-Cluster Sum of Squares): 군집 내 분산 — 작을수록 군집이 응집 - BSS(Between-Cluster Sum of Squares): 군집 간 분산 — 클수록 군집이 분리 - TSS = WCSS + BSS (분산 분해) - 좋은 군집화: WCSS 작고 BSS 큼 군집화 평가 추가 - 응집도(Cohesion): 군집 내 점들의 가까움 — WCSS로 측정 - 분리도(Separation): 군집 간 거리 — BSS로 측정 - 실루엣 계수: 응집도와 분리도를 동시에 반영 군집 알고리즘 큰 분류 - 응집 군집(Agglomerative): 개별 점에서 시작 → 병합 (Bottom-up) - 분할 군집(Divisive): 전체에서 시작 → 분할 (Top-down) 최적 군집 수 결정 - 최적 군집 수(Optimal k) 판단 방법: - 엘보우(Elbow) 방법: WCSS가 급격히 줄다가 완만해지는 지점 - 실루엣 분석: 평균 실루엣 계수가 최대가 되는 k - Gap Statistic: 무작위 데이터 대비 군집 구조의 우수성 - Davies-Bouldin·Calinski-Harabasz Index DBSCAN 추가 개념 - Density-Reachable(밀도 도달 가능): 한 핵심점에서 다른 점까지 핵심점들의 연쇄로 도달 가능 - Density-Connected(밀도 연결): 둘 모두 같은 핵심점에서 도달 가능 - DBSCAN의 군집 정의: 밀도 연결된 점들의 최대 집합 군집 모양·평가 - Compact(응집된/조밀한) Cluster: 군집 내부 거리가 작아 조밀한 군집 - Inter-cluster(군집 간) 이질성: 군집 간 거리가 클수록 좋음 - Intra-cluster(군집 내) 동질성: 군집 내 거리가 작을수록 좋음 단일연결법의 사슬 효과 - 사슬 효과(Chaining Effect): Single Linkage가 점들을 사슬처럼 연결해 길고 가는 군집을 만드는 현상 - 두 군집 사이에 다리(Bridge) 역할 점이 있으면 두 군집이 하나로 병합됨 - 해결: Complete Linkage·Average·Ward 사용 군집 결과 평가 추가 - Bootstrap Stability: 부트스트랩 표본 군집화 결과의 안정성 평가 - Adjusted Rand Index(ARI): 두 군집 결과의 일치도 — 우연 일치 보정 - NMI(Normalized Mutual Information): 정보이론 기반 군집 평가 K-medoids 보강 - K-medoids / PAM(Partitioning Around Medoids): 중심을 실제 데이터 점(medoid)으로 사용 - K-means보다 이상치에 강건, 계산 비용 큼 - CLARA(Clustering Large Applications): 표본 추출로 K-medoids 가속화 거리 행렬 (Distance Matrix) - 거리 행렬(Distance Matrix): n×n 행렬로 모든 쌍의 거리를 저장 - dᵢⱼ = d(xᵢ, xⱼ) - 대각선은 0, 대칭행렬 - 계층적 군집·MDS의 입력 - 비유사도 행렬(Dissimilarity Matrix): 거리 행렬과 동의어로 사용 - 근접성 행렬(Proximity Matrix): 유사도 또는 거리 — 군집·SNA에서 사용 - 거리 행렬의 메모리: O(n²) → 대용량 데이터에서 부담 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 단일/최단 연결법 — 두 군집의 가장 가까운 두 점 거리. 사슬효과(chaining) - 완전/최장 연결법 — 두 군집의 가장 먼 두 점 거리. 작고 조밀한 군집 생성 - Ward 연결법 — 군집 내 분산 증가량이 최소가 되도록 병합 — 균형 잡힌 군집 형성 - EM 알고리즘 / GMM — 데이터가 여러 정규분포의 혼합이라 가정 — 소프트 군집(확률적 소속) - Davies-Bouldin Index — 군집 내 산포 / 군집 간 거리 — 작을수록 좋음 - Calinski-Harabasz Index — 군집 간 분산 / 군집 내 분산 — 클수록 좋음 - 엘보우(Elbow) / 팔꿈치 기법 — WCSS(군집 내 제곱합)를 k에 따라 그려 꺾이는 지점 선택 - 수렴 조건 — 할당 변화 없거나 중심 변화 임계값 이하 - 체비셰프 거리 — max xᵢ−yᵢ — 가장 큰 차원 차이 - Noise / Outlier Point — 핵심점·경계점 어디에도 속하지 않는 점 - K-prototype — 수치형 + 범주형 데이터 동시 처리 — K-means(수치) + K-modes(범주) 결합 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (9개)

K-Means의 한계와 K-medoids의 장점은?
K-Means: 이상치에 민감 (평균 사용)
K-medoids: 실제 데이터 포인트를 중심으로 사용 → 이상치에 강함
DBSCAN의 특징은?
밀도 기반 군집화. K 사전 지정 불필요.
비구형 군집 탐지 가능. 이상치 자동 식별.
파라미터: eps(반경), minPts(최소 데이터 수)
군집분석 품질 평가 지표 2가지는?
엘보우(Elbow): WSS 그래프에서 꺾이는 지점이 최적 K
실루엣 계수: -1~1, 1에 가까울수록 이상적
계층적 군집분석의 연결법 4가지는?
단일연결법(최단 거리)
최장연결법(최대 거리)
평균연결법(평균 거리)
와드연결법(SSE 최소화)
좋은 군집 결과의 조건은?
군집 내 유사성 높음(응집도↑) + 군집 간 유사성 낮음(분리도↑)
실루엣 계수가 1에 가까울수록 이상적
코사인 유사도 vs 자카드 유사도 사용처는?
코사인: 고차원 벡터, 텍스트 (TF-IDF), 방향 비교 / 1=동일
자카드: 집합 또는 이진 데이터 (0과 1) / |A∩B|/|A∪B|
둘 다 0~1 범위
민코프스키 거리에서 p=1, p=2의 의미는?
p=1: 맨해튼 거리 (L1)
p=2: 유클리드 거리 (L2)
p→∞: 체비셰프 거리 (max)
즉 민코프스키는 일반화된 거리
마할라노비스(Mahalanobis) 거리의 특징은?
변수 간 **상관관계**를 고려한 거리 측정
공분산 행렬을 이용해 척도·상관을 보정
변수들이 서로 독립이고 분산이 같으면 유클리드 거리와 동일해짐
SOM(자기조직화지도, Self-Organizing Map)이란?
**경쟁학습 기반 신경망**을 이용한 비지도 군집화 기법
고차원 데이터를 저차원(보통 2D) 격자에 매핑
→ **차원 축소 + 군집화**를 동시에 수행, 시각화에 강함

이 주제의 관련 기출 퀴즈 풀기 »