상관분석

과목: 데이터 분석 (3과목, 5번 주제) ·

키워드: 척도 · 기술통계 · 확률분포 · 상관분석 · 회귀분석 · R 프로그래밍 · 비모수 검정 · 이상치·결측 · 데이터 기반 의사결정 · 점추정·구간추정

정의: 상관분석은 두 변수 사이의 직선적 관계의 강도와 방향을 측정하는 분석입니다.

상관분석은 두 변수 사이의 직선적 관계의 강도와 방향을 측정하는 분석입니다. 상관계수는 -1에서 1 사이의 값을 가지며, 1에 가까울수록 강한 양의 상관관계(한 변수가 증가하면 다른 변수도 증가), -1에 가까울수록 강한 음의 상관관계(한 변수가 증가하면 다른 변수는 감소), 0이면 직선적 상관관계가 없음을 의미합니다. 시험에서 "상관계수가 -1이면 상관관계가 가장 약하다"는 보기가 나오면 틀린 것입니다. -1은 완전한 음의 상관관계이므로 가장 강한 관계입니다. 아래 산점도 모음(위키미디어 Correlationexamples2)을 보면 세 줄로 상관계수의 본질을 한눈에 정리할 수 있습니다. 1행은 r이 +1, 0.8, 0.4, 0, -0.4, -0.8, -1로 변하며 직선 관계의 강도와 방향이 어떻게 달라지는지를 보여 줍니다. 2행은 모든 그림의 r이 0에 가깝지만 점들의 분산만 다른 형태로, 분산이 크다고 해서 상관이 약해지는 것이 아니라는 점을 알려 줍니다. 3행은 곡선·V자·U자처럼 명확한 비선형 패턴이 존재하지만 피어슨 r이 0인 사례입니다. "r=0이면 두 변수 사이에 아무 관계가 없다"는 보기가 시험에 자주 등장하는데, 이는 선형 관계만 없을 뿐 비선형 관계는 있을 수 있으므로 틀린 설명입니다. 피어슨 상관계수는 연속형 변수 간의 선형 관계를 측정할 때 사용합니다. 두 변수가 모두 정규분포를 따르고 선형 관계일 때 가장 적합합니다. 스피어만 상관계수는 서열형(순위형) 변수 간의 관계를 분석할 때 사용하며, 비선형 관계도 어느 정도 파악할 수 있습니다. 시험에서 "스피어만은 범주형 변수의 선형 관계를 설명한다"는 보기가 나오면, 스피어만은 서열형 변수에 사용하고 비선형 관계도 분석 가능하므로 틀린 설명입니다. 또한 명목척도는 순서가 없으므로 스피어만 분석으로 분석할 수 없습니다. 상관분석에서 주의할 점은 상관관계가 인과관계를 의미하지 않는다는 것입니다. 또한 켄달의 타우(Kendall's τ)도 서열형 변수에 적합한 비모수 상관계수로, 스피어만 상관계수와 유사하나 일치쌍과 불일치쌍의 비율로 계산합니다. 피어슨 상관계수(r)의 제곱인 결정계수(R²)는 회귀분석에서 모형 설명력을 나타냅니다. 예를 들어 r=0.8이면 R²=0.64로, 독립변수가 종속변수 분산의 64%를 설명합니다. 스피어만 상관계수는 서열형(순위형) 데이터에 적합하며, 명목척도 변수에는 사용할 수 없습니다. 아이스크림 판매량과 익사 사고 건수가 높은 양의 상관관계를 보이지만, 이는 기온이라는 제3의 변수가 원인이지 아이스크림이 익사를 유발하는 것은 아닙니다. 핵심 요약 & 시험 포인트 상관계수 종류 비교 종류 적용 척도 가정 특징 피어슨(Pearson) 등간·비율척도 정규분포, 선형 관계 모수 검정 스피어만(Spearman) 서열·등간·비율척도 없음 (비모수) 순위 기반, 단조 관계 켄달의 타우(Kendall) 서열 이상 없음 (비모수) 소규모 데이터에 강인 상관계수 해석 범위 해석 \ r\ = 1 완전한 선형 관계 0.7 ≤ \ r\ < 1 강한 상관관계 0.3 ≤ \ r\ < 0.7 중간 상관관계 \ r\ < 0.3 약한 상관관계 r = 0 선형 관계 없음 시험 포인트: 상관관계 ≠ 인과관계. 높은 상관이어도 인과관계는 별도 판단 필요. 피어슨 r의 제곱 = R² (결정계수). 명목척도에는 스피어만 사용 불가. 상관계수 종류 비교 상관계수 데이터 유형 관계 유형 가정 Pearson 연속형 (등간/비율) 선형 관계 정규성, 등분산성 Spearman 순서형 또는 연속형 단조(monotonic) 관계 비모수 Kendall (τ) 순서형 단조 관계 비모수, 작은 표본에 강건 편상관계수(Partial Correlation) - 두 변수의 상관에서 다른 변수의 영향을 통제(고정) 한 후의 순수 상관 - 예: 키-시험 점수 상관에서 "나이" 영향 제거 후 분석 상관계수 해석 - r ≥ 0.7: 강한 상관 - 0.3 ≤ r < 0.7: 중간 - r < 0.3: 약한 상관 - r = 0: 선형 관계 없음 (단, 비선형 관계는 있을 수 있음) 시험 포인트: Pearson은 선형, Spearman/Kendall은 단조. 비정규/이상치 → Spearman 사용. 인과관계 ≠ 상관관계. 표본 공분산 계산 - 표본 공분산: Cov(X, Y) = Σ(xᵢ − x̄)(yᵢ − ȳ) / (n−1) - 표본의 평균(Sample Mean): x̄ = Σxᵢ / n - 공분산은 단위 영향을 받아 절대값 비교 어려움 → 상관계수로 표준화 권장 상관계수 보조 지표 - 편의(Bias): 추정량과 실제 모수의 차이의 기댓값 - 표본 상관계수는 약간의 편의를 가지며 표본 크기가 커질수록 모상관에 수렴 인과관계 vs 상관관계 - 상관관계(Correlation): 두 변수가 함께 변동 — 방향·강도만 측정 - 인과관계(Causality): 한 사건(원인)이 다른 사건(결과)을 발생시킴 — 방향성 + 메커니즘 - "상관관계 ≠ 인과관계": 데이터 사이언스의 핵심 원칙 Mill의 인과 3원칙 (J.S. Mill) 1. 시간 우선성(Temporal Precedence): 원인이 결과보다 시간적으로 앞서야 함 2. 공변성(Covariation / 공변): 원인의 변동에 따라 결과도 변동해야 함 3. 다른 원인 배제(Non-spuriousness): 잠재변수 등 다른 설명을 통제해야 함 가짜 관계 - 허위상관(Spurious Correlation) / 허위관계: 제3의 잠재변수에 의한 가짜 상관 (예: 아이스크림 판매 vs 익사 사고 ← 여름) - 역인과(Reverse Causation): 인과의 방향이 반대 (예: 운동 → 건강이 아니라 건강 → 운동) - 잠재 변수(Latent Variable) / 잠복 변수: 직접 관측 안 되나 결과에 영향 - 교란 변수(Confounding Variable) / 혼란 변수: 원인·결과 모두에 영향을 미쳐 가짜 관계 만듦 인과 추론 (Causal Inference) 기법 - RCT(Randomized Controlled Trial, 무작위 통제 실험): 무작위 배정으로 처치·대조 집단을 만들고 효과 비교 — 인과 추론의 황금 표준(Gold Standard) - 처치/처리 집단(Treatment Group) vs 통제/대조 집단(Control Group) - 의약품 임상시험·웹 A/B 테스트의 기본 - 도구변수(IV, Instrumental Variable): 처치와는 상관 있으나 결과에는 처치를 통해서만 영향 — 관측 불가 교란 완화 - 준실험(Quasi-Experiment) / 자연실험: 무작위 배정 없이 실제 변동을 활용 - 이중차분법(DiD, Difference-in-Differences): 처치 전후·집단 간 차이의 차이로 효과 추정 - 회귀불연속 설계(RDD, Regression Discontinuity Design): 임계값 근처에서 처치 여부가 갈리는 상황 활용 - 성향 점수 매칭(Propensity Score Matching): 관측된 공변량 기반으로 비슷한 짝을 매칭 - 인과 그래프(DAG, Causal Diagram): 변수 간 인과 구조를 방향성 비순환 그래프로 표현 효과의 정의 - ATE(Average Treatment Effect, 평균 처치 효과): 모집단 전체의 평균 효과 - CATE(Conditional ATE): 특정 부분집단의 조건부 효과 - Selection Bias(선택 편향): 비무작위 배정으로 인한 효과 추정 편향 일반화된 상관 측도 - 거리 상관(Distance Correlation): 두 변수의 비선형·고차원 의존성도 포착 - dCor = 0 ⇔ 두 변수가 독립 - 피어슨 상관과 달리 0이 독립을 함의 - MIC(Maximal Information Coefficient): 정보이론 기반 비선형 상관 — 모든 함수형 관계 포착 회귀의 이론적 기초 - Gauss-Markov 정리: 선형·등분산·무자기상관·기댓값 0인 잔차 가정 하에서 OLS가 BLUE 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 표본 공분산 — Cov(X, Y) = Σ(xᵢ − x̄)(yᵢ − ȳ) / (n−1) - 허위상관(Spurious Correlation) / 허위관계 — 제3의 잠재변수에 의한 가짜 상관 (예: 아이스크림 판매 vs 익사 사고 ← 여름) - 역인과 — 인과의 방향이 반대 (예: 운동 → 건강이 아니라 건강 → 운동) - 교란 변수(Confounding Variable) / 혼란 변수 — 원인·결과 모두에 영향을 미쳐 가짜 관계 만듦 - 처치/처리 집단 — vs 통제/대조 집단(Control Group) - 도구변수 — 처치와는 상관 있으나 결과에는 처치를 통해서만 영향 — 관측 불가 교란 완화 - 이중차분법 — 처치 전후·집단 간 차이의 차이로 효과 추정 - 성향 점수 매칭 — 관측된 공변량 기반으로 비슷한 짝을 매칭 - Selection Bias — 비무작위 배정으로 인한 효과 추정 편향 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (7개)

피어슨 vs 스피어만 상관계수의 차이는?
피어슨: 연속형, 정규분포 가정, 선형 관계 측정 (모수)
스피어만: 순위 기반, 분포 가정 없음, 단조 관계 측정 (비모수)
상관관계와 인과관계의 차이는?
상관관계: 두 변수가 함께 변하는 경향 (방향·강도만 알 수 있음)
인과관계: 한 변수가 다른 변수의 원인
(상관이 높아도 인과관계가 없을 수 있음!)
아이스크림 판매↑ & 익사 사고↑는 인과관계인가?
❌ 인과관계 아님. 제3변수(기온)가 원인.
상관관계는 있지만 아이스크림이 익사를 유발하지 않는다.
피어슨 r = 0.8일 때 R²(결정계수)는?
R² = r² = 0.64
독립변수가 종속변수 분산의 64%를 설명한다는 의미
켄달의 타우(Kendall's τ)란?
비모수 상관계수. 스피어만과 유사하지만 소규모 데이터에 더 강인.
일치 쌍/불일치 쌍의 비율로 계산.
Pearson vs Spearman 상관계수 차이는?
Pearson: 연속형, 선형 관계, 정규성 가정
Spearman: 순서형/비정규, 단조(monotonic) 관계, 비모수
이상치 많으면 Spearman 권장
편상관계수(Partial Correlation)란?
두 변수의 상관에서 다른 변수의 영향을 통제(제거)한 후의 순수 상관
예: 키-점수 상관에서 나이의 영향 제거
다중회귀의 부분 효과 해석에 사용

이 주제의 관련 기출 퀴즈 풀기 »