회귀분석

과목: 데이터 분석 (3과목, 6번 주제) ·

키워드: 기술통계 · 확률분포 · 회귀분석 · 로지스틱 회귀 · 시계열 분석 · 군집분석 · 데이터 전처리 · 변수 선택 · 데이터 기반 의사결정 · 데이터 웨어하우스 · 점추정·구간추정 · 모델 선택 기준

정의: 회귀분석은 하나 이상의 독립변수(원인)가 종속변수(결과)에 미치는 영향을 분석하는 방법입니다.

회귀분석은 하나 이상의 독립변수(원인)가 종속변수(결과)에 미치는 영향을 분석하는 방법입니다. 독립변수가 하나이면 단순회귀분석, 여러 개이면 다중회귀분석이라 합니다. 선형회귀의 본질은 "X 값마다 Y가 어떤 분포를 따르는데, 그 분포의 평균이 직선을 이룬다"는 확률적 가정입니다. 아래 위키미디어 그림(Normdistregression)에서 회귀직선 위에 X마다 작은 정규분포 종 모양이 얹혀 있는 모습이 바로 이 의미입니다 — 각 X에서의 조건부 기댓값 E[Y X]을 잇는 직선이 곧 회귀선이며, 관측값에서 회귀선까지의 거리(잔차)는 평균 0인 정규 오차로 가정됩니다. 이 가정이 선형성·등분산성·정규성·독립성이라는 4대 가정의 기하학적 토대입니다. 선형 회귀의 기본 가정은 네 가지입니다. 선형성(독립변수와 종속변수 간에 선형 관계 존재), 독립성(잔차들이 서로 독립), 등분산성(모든 독립변수 값에 대해 잔차의 분산이 동일), 정규성(잔차가 정규분포를 따름)입니다. 결정계수(R²)는 회귀모형이 데이터를 얼마나 잘 설명하는지를 나타내며, SSR(회귀제곱합)/SST(총제곱합)=SSR/(SSR+SSE)로 계산합니다. 아래 위키미디어 그림(CoefficientofDetermination)을 보면 R²의 기하학적 의미가 명확합니다. 데이터의 평균선 ȳ을 기준으로 한 전체 분산(SST) 이 두 부분으로 분해됩니다: 회귀선이 평균선으로부터 벌어진 만큼인 설명된 분산(SSR — 빨간색 화살표) 과, 관측값이 회귀선에서 벗어난 만큼인 잔차 분산(SSE — 회색 화살표) 입니다. R² = SSR/SST는 "전체 변동 중 모형이 설명한 비율"이고, R² = 1 - SSE/SST는 "잔차 비율을 1에서 뺀 값"으로 같은 결과를 내며, R²이 1에 가까울수록 회귀선이 데이터 변동을 더 많이 설명합니다. R² = 1 - SSE/SST로도 표현됩니다. R²는 01 사이 값을 가지며 1에 가까울수록 설명력이 높습니다. 다중회귀에서 독립변수를 추가하면 R²는 항상 증가하므로, 변수 수를 고려한 수정 결정계수(Adjusted R²)를 사용합니다. 수정 결정계수 = 1 - (1-R²)×(n-1)/(n-k-1) 으로, 유의하지 않은 변수를 추가하면 오히려 감소합니다. SSE는 오차제곱합이고 SST=SSR+SSE입니다. MSE(평균제곱오차)=SSE/(n-k-1)이며, n은 표본 수, k는 독립변수 수입니다. 단순회귀(k=1)에서는 SSE/(n-2), 다중회귀(k1)에서는 SSE/(n-k-1)이 됩니다. 분모 n-k-1은 자유도(Degrees of Freedom)로, 추정해야 할 파라미터 수(절편 1개 + 독립변수 k개)를 표본 수에서 뺀 값입니다. 다중공선성(Multicollinearity)은 다중회귀분석에서 독립변수들 간에 강한 상관관계가 존재하여 회귀계수의 추정이 불안정해지는 문제입니다. VIF(분산팽창인자) 지표로 측정하며, 해결 방안으로는 상관관계가 높은 변수를 제거하거나, 라쏘(Lasso) 회귀, 릿지(Ridge) 회귀, 엘라스틱넷(Elastic Net) 회귀 등의 정규화 기법을 사용합니다. 릿지(Ridge/L2)는 회귀계수의 크기를 작게 만들되 0으로 만들지 않아 모든 변수를 유지합니다. 라쏘(Lasso/L1)는 일부 회귀계수를 정확히 0으로 만들어 자동으로 변수 선택 효과를 냅니다. 엘라스틱넷은 릿지(L2)와 라쏘(L1)를 결합한 방법입니다. 로지스틱 회귀는 다중공선성을 해결하는 방법이 아닙니다. 변수 선택 방법으로는 전진선택법(변수를 하나씩 추가), 후진제거법(모든 변수에서 하나씩 제거), 단계별 선택법(추가와 제거를 반복)이 있습니다. 핵심 요약 & 시험 포인트 선형 회귀 기본 가정 (선·독·등·정) 가정 의미 선형성 독립변수와 종속변수 간 선형 관계 독립성 잔차들이 서로 독립 등분산성 모든 X 값에서 잔차의 분산이 동일 정규성 잔차가 정규분포를 따름 주요 계산 공식 지표 수식 의미 R² 1 - SSE/SST = SSR/SST 01, 클수록 설명력 높음 수정 R² 1-(1-R²)×(n-1)/(n-k-1) 다중회귀에서 변수 수 보정 MSE SSE/(n-k-1) 평균제곱오차, k=독립변수 수 정규화 회귀 비교 기법 특징 Ridge(L2) 계수를 줄이되 0으로 만들지 않음 (변수 유지) Lasso(L1) 일부 계수를 정확히 0으로 → 자동 변수 선택 Elastic Net Ridge + Lasso 혼합 시험 포인트: 다중공선성 진단 = VIF. VIF 10이면 심각한 다중공선성. 수정 결정계수는 유의하지 않은 변수 추가 시 감소할 수 있음. 회귀모형 변수 선택 기준 (정보 기준) 여러 모형 중 설명력과 단순함의 균형을 평가하는 지표. 작을수록 좋음. 지표 수식 특징 AIC -2 log(L) + 2k Akaike. 일반적, 예측 중심 BIC -2 log(L) + k × log(n) Bayesian. AIC보다 강한 페널티(표본 클수록), 간결한 모형 선호 Mallows Cp SSE/MSE - n + 2k Cp가 변수 개수 k에 가까울수록 좋음 Adjusted R² 1 - (1-R²)(n-1)/(n-k-1) 클수록 좋음 L: 우도, k: 파라미터 수, n: 표본 크기 변수 선택 알고리즘 - 전진선택(Forward): 빈 모형에서 변수를 하나씩 추가, 더 이상 개선이 없으면 종료 - 후진제거(Backward): 모든 변수에서 시작, 기여도가 낮은 변수를 하나씩 제거 - 단계별(Stepwise): 추가와 제거를 번갈아, 가장 안정적 시험 포인트: AIC, BIC는 작을수록 좋은 모형. n이 커지면 BIC가 더 보수적(변수 적게 선택). 회귀모형 진단 — 잔차 분석 4대 가정 검정 도구 가정 진단 방법 위반 시 패턴 선형성 잔차 vs 적합값 plot 곡선 패턴 등분산성 잔차 vs 적합값 plot 깔때기(funnel) 모양 정규성 Q-Q plot, Shapiro-Wilk 검정 직선에서 벗어남 독립성 더빈-왓슨(Durbin-Watson) 통계량 잔차 시계열 패턴 더빈-왓슨(DW) 통계량 해석 - 범위: 0 4 - DW ≈ 2: 자기상관 없음 (이상적) - DW < 2: 양의 자기상관 - DW 2: 음의 자기상관 - DW < 1 또는 3: 심각한 자기상관 Q-Q Plot 해석 - 잔차의 분위수 vs 정규분포의 분위수 - 직선에 가까울수록 정규성 충족 - S자 형태 → 첨도 문제, 휘어짐 → 왜도 문제 회귀 종류 정리 회귀 종속변수 사용처 단순회귀 연속형 y = β₀ + β₁x 다중회귀 연속형 y = β₀ + β₁x₁ + ... 다항회귀(Polynomial) 연속형, 비선형 곡선 y = β₀ + β₁x + β₂x² 로지스틱 회귀 이진 범주 분류 (확률) 다중 로지스틱 다중 범주 다항 분류 포아송 회귀(Poisson) 카운트 (음 아닌 정수) 사고 건수, 방문 횟수 시험 포인트: 더빈-왓슨이 2 근처면 OK, 0이나 4에 가까울수록 자기상관 심각. 카운트 데이터에는 포아송 회귀. 추가 핵심 개념 — 조정 결정계수와 로지스틱 회귀 보강 - 조정 결정계수(Adjusted R²) = 1 − (1−R²)(n−1)/(n−k−1) — 변수 수 k에 페널티 부여. 다중회귀에서 의미 없는 변수 추가에 따른 R² 자동 증가 문제를 보정. - 로짓(Logit) 변환: ln(p/(1−p)) — 확률 p를 (−∞, ∞)로 매핑해 선형 모형화. 로지스틱 회귀의 핵심 변환. - 오즈비(Odds Ratio, OR) = exp(β): 설명변수 1단위 증가 시 오즈의 곱셈적 변화율. β0 → OR1 (오즈↑), β=0 → OR=1 (영향 없음), β<0 → OR<1 (오즈↓). 시험 핵심: 조정 R²의 페널티 의미, 로짓·오즈비 변환은 회귀 단원의 핵심 출제 포인트입니다. 다중공선성과 진단 - 다중공선성(Multicollinearity): 독립변수 간 강한 상관 — 회귀계수 추정이 불안정해지고 부호가 뒤바뀔 수 있음 - 분산팽창인수(VIF, Variance Inflation Factor): VIFⱼ = 1/(1 − Rⱼ²). VIF 10이면 다중공선성 의심, 5 주의 - 공차한계(Tolerance): 1/VIF — 0.1 미만이면 문제 - 상태지수(Condition Number): 30 이상이면 다중공선성 잔차 진단 - 잔차분석(Residual Analysis): 잔차의 정규성·등분산성·독립성·선형성 확인 - QQ-Plot: 잔차 정규성 시각 진단 - 표준화 잔차(Standardized Residual): 잔차를 표준편차로 나눈 값, z 23이면 이상치 의심 - 스튜던트화 잔차(Studentized Residual): 해당 관측치를 제외하고 추정한 표준편차로 표준화 - 쿡의 거리(Cook's Distance): 한 관측치가 회귀계수에 미치는 영향. 4/n 또는 1 주의 - 지렛값(Leverage): 독립변수 공간에서의 극단값 정도. (p+1)/n의 23배 초과 시 주의 - 더빈왓슨(Durbin-Watson) 통계량: 잔차의 자기상관 진단. 2 근처면 무자기상관, 0에 가까우면 양의 자기상관 변수 선택법 - 전진선택법(Forward Selection): 절편만으로 시작 → 가장 유의한 변수를 하나씩 추가 - 후진제거법(Backward Elimination): 모든 변수로 시작 → 가장 덜 유의한 변수를 하나씩 제거 - 단계적 선택법(Stepwise Selection): 전진·후진을 결합 — 추가/제거를 반복하며 최적 모형 탐색 - Mallow's Cp / AIC / BIC / 수정 결정계수: 변수 선택 기준(모형 적합도 vs 복잡도) - 수정 결정계수(Adjusted R²): 변수 수가 늘어도 자동 증가하지 않도록 보정 정규화 회귀 (Regularized Regression) - Ridge 회귀: L2 페널티 (λΣβ²). 계수를 0에 가깝게 축소하지만 0이 되지는 않음. 다중공선성 완화에 유리 - Lasso 회귀: L1 페널티 (λΣ β ). 일부 계수를 정확히 0으로 만들어 변수 선택 효과 - Elastic Net: L1 + L2 페널티 결합. Lasso의 변수 선택 + Ridge의 안정성 회귀에서의 범주형 처리 - 더미변수(Dummy Variable): 범주형 변수를 0/1 변수로 변환 (k개 범주 → k−1개 더미) - 참조 범주(Reference Category): 더미로 변환할 때 기준이 되는 범주, 계수는 참조 대비 효과 회귀 모형 확장 - 다항회귀(Polynomial Regression): y = β₀ + β₁x + β₂x² + … — 비선형 관계를 다항식으로 표현(여전히 계수에는 선형) - 교호작용(Interaction Effect): x₁·x₂ 항을 추가해 변수 간 상호작용 모델링 - 주효과(Main Effect): 개별 변수의 단독 효과 - 공변량(Covariate): 결과에 영향을 줄 수 있으나 주관심 변수가 아닌 통제 변수 - ANCOVA(공분산분석): ANOVA에 공변량을 추가해 그룹 간 차이를 더 정밀하게 비교 일반화선형모형 (GLM) - GLM(Generalized Linear Model): 선형회귀를 일반화 — 연결함수(link function)와 분포족(family)을 선택 - 로지스틱 회귀: 종속변수가 이진(베르누이) — link: logit, 출력은 오즈비 - 포아송 회귀: 종속변수가 계수(count) — link: log - 로짓(Logit): log(p/(1−p)) — 오즈의 로그 - 오즈(Odds): p/(1−p) — 성공 확률 대비 실패 확률 비율 - 오즈비(Odds Ratio): 두 그룹의 오즈 비율, 로지스틱 회귀계수의 exp(β) 최소제곱법 (OLS) - OLS(Ordinary Least Squares, 최소제곱법): 잔차 제곱합(SSE)을 최소화하는 회귀계수 추정 방법 — 선형회귀의 기본 - 분산 분해: SST = SSR + SSE - SST(Total Sum of Squares): 전체 변동 Σ(yᵢ − ȳ)² - SSR(Regression Sum of Squares): 회귀가 설명하는 변동 Σ(ŷᵢ − ȳ)² - SSE(Error Sum of Squares, 잔차제곱합): 잔차의 변동 Σ(yᵢ − ŷᵢ)² - R² = SSR / SST 회귀의 4가지 가정 (LINE) - 선형성(Linearity): y와 x의 관계가 선형 — 잔차도로 확인 - 독립성(Independence): 잔차들이 서로 독립 — Durbin-Watson 검정 - 정규성(Normality): 잔차가 정규분포 — QQ-Plot·Shapiro-Wilk - 등분산성(Homoscedasticity): 잔차의 분산이 일정 — Breusch-Pagan 검정 - 이분산성(Heteroscedasticity): 등분산성 위반 → 가중최소제곱(WLS)·로그변환으로 처리 계수 검정 - 회귀계수의 유의성: t 검정 또는 p-value로 H₀: βⱼ = 0 검정 - 표준화 계수(Standardized Coefficient, 베타 계수): 변수의 단위 영향 제거 — 변수 간 상대적 중요도 비교 - 모형 적합도(Goodness of Fit): R²·Adj R²·AIC·BIC 종합 회귀 구분 용어 - 단순회귀(Simple Regression): 독립변수 1개 - 다중회귀(Multiple Regression): 독립변수 ≥ 2개, 종속변수 1개 - 다변량 회귀(Multivariate Regression): 종속변수 ≥ 2개 (다중회귀와 구분) 회귀모형의 진단 추가 - Breusch-Godfrey 검정: 일반화된 자기상관 검정 (다중회귀에서도 사용 가능) - 회귀모형의 진단 절차: 잔차도 → 정규성(QQ-Plot) → 등분산성(잔차 vs 적합값) → 독립성(Durbin-Watson) → 영향관측치(Cook's D) 결측치 회귀 대체 - 회귀 대체(Regression Imputation): 결측치를 회귀모형의 예측값으로 대체 — 분산 과소추정 문제 - 다중대체(MICE, Multiple Imputation by Chained Equations): 여러 차례 대체하여 분산 추정 보정 회귀 모형 종류 정리 - 단순선형회귀(Simple Linear Regression): y = β₀ + β₁x + ε — 독립변수 1개 - 다중선형회귀(Multiple Linear Regression): y = β₀ + β₁x₁ + ... + βₚxₚ + ε — 독립변수 ≥ 2 - 다항회귀(Polynomial): 독립변수의 거듭제곱 항 추가 — 비선형 관계 모델링 로지스틱 회귀 변형 - 이항 로지스틱(Binary Logistic): Y가 두 클래스 - 다항 로지스틱(Multinomial Logistic): Y가 3개 이상 명목형 클래스 - 순서형 로지스틱(Ordinal Logistic): Y가 순서를 갖는 범주 변수 선택 추가 - Best Subset Selection(최적 변수 부분집합): 가능한 모든 부분집합(2^p)을 평가해 최적 선택 — 변수 수가 많으면 계산 폭증 - 단계적 방법(전진/후진/Stepwise): Best Subset의 근사적 대안 회귀 진단 추가 - 조건수(Condition Number): X'X 행렬의 최대/최소 고유값 비율의 제곱근. 30 이상이면 다중공선성 의심 - DFBETAS / DFFITS: 특정 관측치가 회귀계수·예측값에 미치는 영향 - 이상관측치(Influential Observation): 회귀결과를 크게 좌우하는 관측치 회귀에서의 변수 명칭 - 독립 변수(Independent Variable) / 예측 변수(Predictor) / 설명 변수(Explanatory Variable) / 입력 변수: x — 같은 의미의 다양한 이름 - 종속 변수(Dependent Variable) / 반응 변수(Response Variable) / 결과 변수(Outcome) / 출력 변수: y - 타깃 변수(Target Variable): 머신러닝에서 y의 일반적 명칭 회귀 기본 요소 - 절편(Intercept, β₀): x = 0일 때 y의 기대값 - 기울기(Slope, β₁): x가 1 증가할 때 y의 평균 변화량 - 회귀선(Regression Line): 최소제곱 추정으로 얻은 직선·곡면 - 최소제곱 추정량(Least Squares Estimator): 잔차 제곱합을 최소화하는 추정량 잔차의 성질 - 잔차의 합 = 0: OLS의 결과로 자동 만족 (절편 포함 시) - 잔차의 평균 = 0: 잔차의 합이 0이므로 평균도 0 - 잔차의 분포: 회귀 가정에서는 평균 0인 정규분포 — QQ-Plot으로 확인 결정계수 추가 - 결정계수의 의미: 모형이 설명하는 변동의 비율 — 01 - 수정 결정계수(Adjusted R², 조정 R²): 변수 수 증가에 따른 R² 자동 증가 보정 → 변수 비교·선택에 유용 회귀 전체 모형 검정 (F-검정) - F-통계량(F-statistic): 회귀 모형이 모든 변수를 사용해 의미 있게 설명하는가? - F = (SSR/p) / (SSE/(n−p−1)) = MSR / MSE - 귀무가설 H₀: β₁ = β₂ = ... = βₚ = 0 (모든 회귀계수 0) - F가 크고 p-value < α이면 H₀ 기각 → 모형이 유의함 - 회귀 F검정: 단일 계수 t-검정과 달리 전체 모형의 유의성을 한 번에 평가 회귀모형의 적합도 - 회귀모형의 적합도(Goodness of Fit): 모형이 데이터를 얼마나 잘 설명하는가 - 지표: R²·Adj R²·F-통계·잔차 분석·AIC·BIC·RMSE - R² 단독으로 적합도 판단은 위험 → 잔차 진단 동반 필수 단계적 회귀 (Stepwise Regression) - Stepwise Regression: 변수를 한 번에 하나씩 추가·제거하며 최적 모형 탐색 - 전진 선택(Forward) + 후진 제거(Backward): 각 단계에서 추가·제거를 모두 고려 - 기준: AIC·BIC·F 통계량·수정 결정계수 - 장점: Best Subset(2^p)보다 계산 효율적 - 단점: 국소 최적, 다중 검정 문제 다중 회귀 추가 - 단순 회귀(Simple Regression) vs 다중 회귀(Multiple Regression): 독립변수 수 - 다중 회귀의 가정: 선형성·독립성·정규성·등분산성 + 다중공선성 없음 회귀 추가 기법 - 교호작용항(Interaction Term): x₁·x₂ 형태로 두 변수의 상호작용을 모델링 — 한 변수의 효과가 다른 변수에 의존 - 로짓 변환(Logit Transformation): log(p/(1−p)) — 확률을 무한 범위로 변환, 로지스틱 회귀의 연결함수 - 데이터 중심화(Centering): x − x̄로 평균을 0으로 — 절편 해석 변경·교호작용 다중공선성 완화 - Box-Cox 변환: y의 거듭제곱·로그 변환으로 정규성·등분산성 확보 정규화 회귀 추가 - 릿지 회귀(Ridge Regression) 추가: L2 페널티 λΣβ² - 모든 계수 0에 가깝게 축소(0으로 가지는 않음) - 다중공선성 환경에서 안정적 - λ 선택: 교차검증 Mallow's Cp - Mallow's Cp: 모형 적합도 + 변수 수 페널티 — Cp ≈ p+1이면 좋은 모형 AIC와 BIC 비교 - AIC(Akaike Information Criterion): 2k − 2·log(L) — k는 파라미터 수, L은 우도 - 작을수록 좋음 - 예측 성능을 우선 - BIC(Bayesian Information Criterion): k·log(n) − 2·log(L) — n은 표본 크기 - 작을수록 좋음 - AIC보다 더 강한 페널티 → 단순 모형 선호 - 표본이 클수록 BIC가 단순 모형 선호 경향 - 활용: 변수 선택·모델 비교·시계열 차수 결정 (ARIMA) - 일반적으로 AIC는 예측, BIC는 진실 모형 선택에 유리 Mallow's Cp 다시 - Cp = SSE/MSEfull − n + 2(p+1) - Cp ≈ p+1이면 좋은 모형 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 분산팽창인수 — VIFⱼ = 1/(1 − Rⱼ²). VIF 10이면 다중공선성 의심, 5 주의 - 잔차분석 — 잔차의 정규성·등분산성·독립성·선형성 확인 - 표준화 잔차 — 잔차를 표준편차로 나눈 값, z 23이면 이상치 의심 - 스튜던트화 잔차 — 해당 관측치를 제외하고 추정한 표준편차로 표준화 - 쿡의 거리 — 한 관측치가 회귀계수에 미치는 영향. 4/n 또는 1 주의 - 지렛값 — 독립변수 공간에서의 극단값 정도. (p+1)/n의 23배 초과 시 주의 - 더빈왓슨통계량 — 잔차의 자기상관 진단. 2 근처면 무자기상관, 0에 가까우면 양의 자기상관 - Mallow's Cp / AIC / BIC / 수정 결정계수 — 변수 선택 기준(모형 적합도 vs 복잡도) - R² = SSR / SST — 회귀의 4가지 가정 (LINE) - 표준화 계수 — 변수의 단위 영향 제거 — 변수 간 상대적 중요도 비교 - 다변량 회귀 — 종속변수 ≥ 2개 (다중회귀와 구분) - 회귀모형의 진단 절차 — 잔차도 → 정규성(QQ-Plot) → 등분산성(잔차 vs 적합값) → 독립성(Durbin-Watson) → 영향관측치(Cook… - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (10개)

선형 회귀의 4가지 기본 가정은?
선형성 / 독립성(잔차 서로 독립) / 등분산성 / 정규성
(선·독·등·정)
결정계수(R²)와 수정 결정계수(Adjusted R²)의 차이는?
R²: 변수 추가 시 항상 증가 (단점)
수정 R²: 유의하지 않은 변수 추가 시 감소
다중회귀에서는 수정 R² 사용 권장
Ridge vs Lasso 정규화 회귀의 차이는?
Ridge(L2): 계수를 작게 만들되 0으로 만들지 않음 (변수 유지)
Lasso(L1): 일부 계수를 정확히 0으로 만들어 자동 변수 선택
다중공선성(Multicollinearity)이란? 진단 방법은?
독립변수 간 강한 상관관계로 회귀계수 추정이 불안정해지는 문제
진단: VIF(분산팽창인자), VIF > 10이면 심각
MSE = SSE/(n-k-1)에서 n, k는 무엇인가?
n = 표본 수, k = 독립변수 수
분모 n-k-1 = 자유도 (절편 1개 + 독립변수 k개 제외)
AIC vs BIC 차이는?
AIC: -2log(L) + 2k, 예측 중심
BIC: -2log(L) + k×log(n), 표본 크기 페널티 → 더 간결한 모형 선호
둘 다 작을수록 좋음
회귀 변수 선택법 3가지는?
전진선택(Forward): 빈 모형 → 한 번에 하나씩 추가
후진제거(Backward): 전체 모형 → 하나씩 제거
단계별(Stepwise): 추가+제거 반복, 가장 안정적
더빈-왓슨(Durbin-Watson) 통계량의 해석은?
범위 0~4. 잔차의 자기상관 검정
DW ≈ 2: 자기상관 없음 (이상적)
DW < 2: 양의 자기상관
DW > 2: 음의 자기상관
DW < 1 또는 > 3: 심각
회귀 잔차 vs 적합값 plot에서 깔때기 모양이면?
등분산성(homoscedasticity) 위반
→ 가중 최소제곱(WLS), 로그 변환, Box-Cox 변환 등으로 해결
카운트(0 이상 정수) 데이터의 회귀는?
포아송 회귀(Poisson Regression)
예: 사고 건수, 방문 횟수, 콜센터 통화 수
분산 = 평균 가정 (위반 시 음이항 회귀)

이 주제의 관련 기출 퀴즈 풀기 »