시계열 분석은 시간의 흐름에 따라 관측된 데이터(시계열 데이터)를 분석하여 패턴을 파악하고 미래를 예측하는 방법입니다. 시계열 데이터는 네 가지 구성요소로 분해할 수 있습니다. 추세요인(Trend)은 장기적으로 일정한 방향으로 상승 또는 하락하는 경향입니다. 계절요인(Seasonal)은 일정한 주기를 가지고 반복되는 규칙적인 변동으로, 주기가 고정되어 있습니다. 순환요인(Cyclical)은 경제 순환 등으로 인한 변동으로, 계절요인과 달리 주기가 고정되어 있지 않고 알려지지 않은 주기를 가집니다. 시험에서 "순환요인은 알려진 주기 또는 고정된 주기로 반복된다"는 보기가 나오면 이는 계절요인의 설명이므로 틀린 것입니다. 불규칙요인(Irregular)은 위 세 가지 요인으로 설명할 수 없는 무작위 오차입니다. 정상 시계열이란 시점에 무관하게 평균과 분산이 일정하고, 공분산이 시차(Lag)에만 의존하는(시점에는 의존하지 않는) 시계열을 말합니다. 비정상 시계열을 정상화하는 방법으로는 차분(데이터 간의 차이를 계산)과 변환(로그 변환 등)이 있습니다. 평균이 일정하지 않으면 차분을, 분산이 일정하지 않으면 변환을 사용합니다. 백색잡음(White Noise)은 평균 0, 일정한 분산을 가지며 자기상관이 없는 정상 시계열입니다. "백색잡음은 비정상 시계열"이라는 보기는 틀린 것입니다. ARIMA(p,d,q) 모델은 자기회귀(AR), 차분(I), 이동평균(MA)을 결합한 모델로, p는 자기회귀 차수, d는 차분 차수, q는 이동평균 차수입니다. 일반적으로 먼저 차분으로 정상성을 확보한 뒤 자기회귀와 이동평균 차수를 결정합니다. 정상성 검정 방법으로는 ADF 검정(Augmented Dickey-Fuller Test)이 대표적입니다. ADF 검정은 단위근(Unit Root) 존재 여부를 통계적으로 검정하여 시계열이 비정상인지 판단합니다. 귀무가설은 "단위근이 존재한다(비정상 시계열)"이며, p-value가 유의수준보다 작으면 귀무가설을 기각하여 정상 시계열로 판단합니다. KPSS 검정은 귀무가설이 "정상 시계열"로 ADF와 반대이므로 주의해야 합니다. KPSS에서 p-value < α이면 귀무가설(정상 시계열) 기각 → 비정상 시계열로 판단합니다. ADF는 p-value < α이면 귀무가설(비정상 시계열) 기각 → 정상 시계열로 판단하므로, 두 검정의 귀무가설이 반대임을 기억해야 합니다. 핵심 요약 & 시험 포인트 시계열 구성요소 4가지 요인 특징 추세(Trend) 장기적 상승/하락 경향 계절(Seasonal) 고정 주기 반복 변동 (주기 알려짐) 순환(Cyclical) 비고정 주기 변동 (주기 미상) 불규칙(Irregular) 무작위 오차 시험 포인트: "순환요인은 고정된 주기로 반복"은 틀린 설명입니다. 이것은 계절요인의 특징입니다. 정상성 확보 & 검정 구분 방법 평균이 비일정 차분(Differencing) 분산이 비일정 로그 변환 또는 Box-Cox 변환 정상성 검정 ADF 검정 (귀무가설: 비정상, p<α → 정상) 시험 포인트: 백색잡음(White Noise)은 정상 시계열입니다. "백색잡음은 비정상"이라는 보기는 틀립니다. ARIMA(p, d, q) - p: 자기회귀(AR) 차수 / d: 차분(I) 차수 / q: 이동평균(MA) 차수 지수평활법 (Exponential Smoothing) 과거 관측값에 지수적으로 감소하는 가중치를 부여해 예측하는 기법입니다. 최근 데이터에 더 큰 가중치. 모형 적용 대상 평활상수 단순 지수평활 추세·계절 없는 시계열 α (수준) 이중 지수평활(Holt) 추세 있음 α(수준) + β(추세) 삼중 지수평활(Holt-Winters) 추세 + 계절 모두 α + β + γ(계절) α 값이 클수록 최근 데이터에 더 큰 비중. α가 작으면 평활 효과↑ 안정성↑. ACF / PACF — ARIMA 모형 식별 함수 의미 ACF(자기상관함수) 시차 k에서의 자기상관 (간접 효과 포함) PACF(편자기상관함수) 중간 시차의 효과를 제거한 순수 상관 ARIMA(p,d,q) 식별 가이드 모형 ACF PACF AR(p) 점진적 감소 (지수·사인) p시차 후 절단 MA(q) q시차 후 절단 점진적 감소 ARMA(p,q) 점진적 감소 점진적 감소 시험 포인트: PACF가 절단되면 AR, ACF가 절단되면 MA, 둘 다 점진적 감소면 ARMA. ARIMA의 d는 정상화 차분 횟수. 시계열 분해 모형 — 가법 vs 승법 모형 수식 적용 가법모형(Additive) Yt = Tt + St + Ct + It 계절 변동의 폭이 추세와 무관하게 일정 승법모형(Multiplicative) Yt = Tt × St × Ct × It 계절 변동 폭이 추세에 비례 변동 폭이 시간에 따라 커지면 승법모형. 로그 변환 후 가법모형으로 다룰 수도 있음. Box-Cox 변환 (Power Transformation) 분산이 일정하지 않거나 비정규일 때 데이터를 변환하여 정상화하는 기법. 수식 - y(λ) = (y^λ - 1) / λ (λ ≠ 0) - y(λ) = log(y) (λ = 0) λ 값에 따른 변환 λ 변환 사용처 -1 1/y (역수) 강한 우편향 -0.5 1/√y (역제곱근) 중간 우편향 0 log(y) (로그) 우편향, 분산 비례 평균 0.5 √y (제곱근) 약한 우편향 1 y (변환 없음) 정규에 가까움 2 y² (제곱) 좌편향 Box-Cox 사용법 1. 데이터에서 최적 λ를 최대우도 추정으로 결정 2. 결정된 λ로 변환 적용 3. 회귀·시계열 분석 진행 제약과 대안 - 양의 값에만 적용 가능 (음수 시 사용 불가) - 음수 포함 데이터: Yeo-Johnson 변환 사용 시험 포인트: 분산이 시간에 따라 커지는 시계열 → 로그(Box-Cox λ=0) 변환. λ를 데이터로부터 추정하므로 자동 변환 가능. 추가 핵심 개념 — 지수평활법·SARIMA·정상성 검정 - 지수평활법(Exponential Smoothing) 3종: - 단순(SES, Simple): 추세·계절성 없는 시계열, 수준만 추정 - Holt 이중(Double): 수준 + 추세 (계절성 없음) - Holt-Winters 삼중(Triple): 수준 + 추세 + 계절 (가법 모형: 계절 폭 일정 / 승법 모형: 계절 폭이 추세에 비례) - SARIMA(p, d, q)(P, D, Q)ₛ: ARIMA에 계절성을 추가한 확장 모형. 소문자 = 비계절 차수, 대문자 = 계절 차수, s = 주기. - Box-Cox 변환: y(λ) = (y^λ−1)/λ (λ≠0), log(y) (λ=0). 분산 안정화·정규성 변환. y 0 가정. 음수 포함 데이터에는 Yeo-Johnson 변환 사용. - 정상성 검정 — ADF vs KPSS: - ADF(Augmented Dickey-Fuller): H₀ = 단위근 있음(비정상). p < α면 정상. - KPSS(Kwiatkowski-Phillips-Schmidt-Shin): H₀ = 정상. p < α면 비정상. - 둘 다 정상이라고 판정하면 가장 신뢰도 높음. 시험 핵심: 추세·계절성 유무에 따른 지수평활 선택, ADF·KPSS의 귀무가설 방향 차이가 시계열 단원의 핵심입니다. 시계열 핵심 진단 도구 - ACF(자기상관함수, Autocorrelation Function): 시차 k의 자기상관 계수 — AR 차수 식별보다 MA 차수 식별에 사용 - PACF(부분자기상관함수, Partial ACF): 중간 시차의 영향을 제거한 자기상관 — AR 차수 식별에 사용 - 백색잡음(White Noise): 평균 0, 일정한 분산, 무자기상관인 무작위 시계열 — 좋은 모형의 잔차는 백색잡음이어야 함 - 단위근(Unit Root): 시계열이 비정상성을 갖는 원인. ADF 검정으로 진단 - 확률보행(Random Walk): yₜ = yₜ₋₁ + εₜ. 단위근을 가지므로 차분이 필요 - 차분(Differencing): yₜ − yₜ₋₁ — 추세 제거. 1차 차분으로 부족하면 2차 차분 또는 계절 차분 시계열 모형 계열 - AR(p) 모형: 자기회귀 — 과거 p개 시점의 선형결합 - MA(q) 모형: 이동평균 — 과거 q개 오차항의 선형결합 - ARMA(p,q): AR + MA 결합 - ARIMA(p,d,q): ARMA에 차분(d) 추가 — 비정상 시계열에 적용 - SARIMA: ARIMA에 계절 성분(P,D,Q,s) 추가 지수평활법 - 단순 지수평활: 수준만 모형화 - Holt: 수준 + 추세 - Holt-Winters: 수준 + 추세 + 계절 — 가법/승법 모델 시계열 분해 (Decomposition) - 시계열 분해: 시계열을 추세(T) + 계절(S) + 순환(C) + 불규칙(I) 성분으로 나누어 분석 - 가법 모형: Y = T + S + C + I (계절 진폭이 일정할 때) - 승법 모형: Y = T × S × C × I (계절 진폭이 추세에 비례할 때) - STL(Seasonal-Trend decomposition using Loess): LOESS 평활을 활용한 강건한 분해 — 계절성 변화·이상치에 강함 - 고전적 분해: 이동평균으로 추세 추정 → 잔차에서 계절성 추정 평활 방법 - 이동평균법(Moving Average, MA): 일정 구간 평균으로 단기 변동 제거 - 단순 이동평균 / 가중 이동평균: 모든 시점 동일 가중 vs 최근일수록 큰 가중 - EWMA(Exponentially Weighted Moving Average): 가중치가 지수적으로 감쇠 — 지수평활과 동치 - 추세 분석(Trend Analysis): 장기 추세선 식별·외삽 확률 과정 - 마르코프 체인(Markov Chain): 미래 상태가 현재 상태에만 의존 (마르코프 성질) - MCMC(Markov Chain Monte Carlo): 마르코프 체인을 이용한 베이지안 추론의 핵심 알고리즘 — Gibbs·Metropolis-Hastings 정상성 (Stationarity) - 정상성(Stationarity): 시계열의 통계적 성질이 시간에 따라 변하지 않는 성질 - 약정상성(Weak Stationarity, 공분산정상성): 평균·분산·자기공분산이 시간에 무관 — 실무에서 보통 이 정의 사용 - 강정상성(Strong Stationarity): 모든 시점의 결합분포가 시간 이동에 불변 — 매우 강한 조건 - 단위근 검정(ADF·KPSS·PP): 정상성 진단 — 비정상이면 차분으로 정상화 시계열의 4가지 변동 성분 - 추세변동(Trend): 장기적 증가·감소 경향 - 계절변동(Seasonality): 1년·1주 등 고정 주기의 반복 - 순환변동(Cycle): 주기가 일정하지 않은 장기 진동 (경기 사이클) - 불규칙변동(Irregular/Random): 설명되지 않는 잔여 변동 시계열 분해 (Time Series Decomposition) 추가 - 분해의 목적: 각 성분을 분리해 추세·계절·주기·잡음을 이해하고 모형화 - 고전적 분해 vs STL vs X-13ARIMA-SEATS: 점진적 정교화 예측 오차 지표 - 예측 오차(Forecast Error): 실제값 − 예측값 - MAPE(Mean Absolute Percentage Error): 100·Σ 오차/실제 / n — 단위 무관 - RMSPE(Root MSE Percentage Error): √(Σ(오차/실제)² / n) × 100 - SMAPE(Symmetric MAPE): 분모를 실제+예측의 평균으로 — 분모가 0에 가까운 문제 완화 잔차 분석 - 잔차의 정상성·백색잡음 여부: 좋은 시계열 모형의 잔차는 자기상관이 없어야 함 — Ljung-Box 검정 정상성 검정 추가 - ADF(Augmented Dickey-Fuller) 검정: 단위근 존재 여부 — H₀: 단위근 있음(비정상) - KPSS 검정: H₀: 정상성 — ADF와 정반대 방향 - Phillips-Perron 검정: ADF의 변형, 이분산·자기상관에 강건 지수평활법 계층 - 단순 지수평활(Simple Exponential Smoothing): 수준만 - Holt 방법: 수준 + 추세 - Holt-Winters / Triple Exponential Smoothing: 수준 + 추세 + 계절 확장 모형 - ARIMAX / SARIMAX: 외생변수(Exogenous variable)를 포함한 ARIMA/SARIMA - VAR(Vector Autoregression): 여러 시계열을 동시에 모형화 — 거시경제·금융에 사용 모형 진단 - Ljung-Box 검정: 잔차의 자기상관 여부 — 백색잡음이어야 좋은 모형 시계열 특성 추가 - 추세성(Trend): 시간에 따른 일관된 증가·감소 패턴 — 선형/비선형 - 주기성(Periodicity): 일정한 간격으로 반복되는 패턴 — 계절성과 구분 (계절은 주기가 1년 등 고정) - 시간 의존성(Temporal Dependence): 인접 시점 간 상관관계가 시계열의 본질 장기 의존성 - Long-term Dependency(장기 의존성): 멀리 떨어진 시점들 사이에 의존성이 존재 - RNN의 한계: vanishing gradient 때문에 장기 의존성 학습 곤란 - LSTM·GRU·Transformer: 장기 의존성 처리를 위해 등장한 구조 지수평활 추가 변형 - Brown's Single Exponential Smoothing(브라운 단순지수평활): 가장 기본 형태 - Brown's Linear / Double Exponential Smoothing: 추세 포함 - Damped Trend(감쇠 추세): 미래 추세 효과를 점차 감소시킴 — 장기 예측에서 추세 폭주 방지 - 상태공간(State Space) 모형: 지수평활을 통계적으로 일반화 — ETS(Error·Trend·Seasonal) 시계열 예측 평가 - MAPE(Mean Absolute Percentage Error): 단위 무관, 0 근처 값에서 불안정 - MASE(Mean Absolute Scaled Error): Naive 예측 대비 정규화 — 단위·스케일 무관 시계열 데이터 분석 - 시계열 데이터 분석(Time Series Data Analysis): 시간 순서가 있는 데이터의 패턴·구조 분석 - 절차: 시각화 → 정상성 확인 → 모형 식별 → 적합·진단 → 예측·평가 - 활용: 매출 예측·주가 분석·날씨 예측·IoT 센서 모니터링 자기회귀성 - 자기회귀성(Autoregressive Property): 현재 값이 과거 값에 의존하는 시계열 특성 - ACF·PACF로 진단 - AR(p) 모형은 자기회귀성을 명시적으로 모델링 추세 제거 (Detrending) - Detrending(추세 제거): 시계열에서 추세 성분을 제거해 정상성 확보 - 방법: - 차분(Differencing): 1차 차분 yₜ − yₜ₋₁, 2차 차분 - 회귀: 시간을 독립변수로 회귀 후 잔차 - 이동평균 제거: 이동평균을 빼서 단기 변동만 - HP 필터(Hodrick-Prescott): 추세·순환을 분리하는 필터 시계열 연산자 - Backshift Operator(후행 연산자, B 또는 L): B·yₜ = yₜ₋₁ - Lag Operator(시차 연산자): 동의어 - AR(1): yₜ = φ·yₜ₋₁ + εₜ → (1 − φB)yₜ = εₜ - ARMA·ARIMA 모형을 다항식 형태로 표현하는 데 사용 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 확률보행 — yₜ = yₜ₋₁ + εₜ. 단위근을 가지므로 차분이 필요 - AR모형 — 자기회귀 — 과거 p개 시점의 선형결합 - MA모형 — 이동평균 — 과거 q개 오차항의 선형결합 - SARIMA — ARIMA에 계절 성분(P,D,Q,s) 추가 - 가법 모형 — Y = T + S + C + I (계절 진폭이 일정할 때) - 승법 모형 — Y = T × S × C × I (계절 진폭이 추세에 비례할 때) - 고전적 분해 — 이동평균으로 추세 추정 → 잔차에서 계절성 추정 - 단순 이동평균 / 가중 이동평균 — 모든 시점 동일 가중 vs 최근일수록 큰 가중 - RMSPE — √(Σ(오차/실제)² / n) × 100 - Phillips-Perron 검정 — ADF의 변형, 이분산·자기상관에 강건 - ARIMAX / SARIMAX — 외생변수(Exogenous variable)를 포함한 ARIMA/SARIMA - 시간 의존성 — 인접 시점 간 상관관계가 시계열의 본질 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
시계열 분석
과목: 데이터 분석 (3과목, 7번 주제) ·
키워드: 빅데이터 3V/5V · 기술통계 · 가설검정 · 시계열 분석 · 변수 변환
정의: 시계열 분석은 시간의 흐름에 따라 관측된 데이터(시계열 데이터)를 분석하여 패턴을 파악하고 미래를 예측하는 방법입니다.
핵심 Q&A (10개)
- 시계열 데이터의 4가지 구성요소는?
- 추세(Trend): 장기적 방향성
계절(Seasonal): 고정 주기 반복
순환(Cyclical): 비고정 주기 변동
불규칙(Irregular): 무작위 오차 - 순환요인 vs 계절요인의 차이는?
- 계절요인: 주기가 고정되어 있음 (매년 여름=성수기)
순환요인: 주기가 알려지지 않음 (경제 순환 등) - 비정상 시계열을 정상화하는 방법은?
- 평균 비일정 → 차분(Differencing)
분산 비일정 → 로그 변환 / Box-Cox 변환
백색잡음은 정상 시계열! - ARIMA(p, d, q)의 p, d, q는?
- p: 자기회귀(AR) 차수
d: 차분(I) 차수
q: 이동평균(MA) 차수 - ADF 검정(Augmented Dickey-Fuller)이란?
- 정상성 검정 방법. 귀무가설: "비정상 시계열"
p < α → 귀무가설 기각 → 정상 시계열
(KPSS는 귀무가설이 반대!) - 지수평활법 — Holt vs Holt-Winters 차이는?
- Holt(이중 지수평활): 수준 + 추세 (α, β)
Holt-Winters(삼중 지수평활): 수준 + 추세 + 계절 (α, β, γ)
계절성이 있으면 Holt-Winters 사용 - ACF가 q시차 이후 절단되면 어떤 모형인가?
- MA(q) — 이동평균 모형
반대로 PACF가 p시차 이후 절단되면 AR(p)
둘 다 점진적으로 감소하면 ARMA(p,q) - 시계열 가법모형 vs 승법모형 적용 기준은?
- 가법모형 (Y=T+S+C+I): 계절 변동 폭이 시간에 무관하게 일정
승법모형 (Y=T×S×C×I): 계절 변동 폭이 추세 크기에 비례하여 증가
로그 변환 시 승법→가법 변환 가능 - Box-Cox 변환의 λ=0과 λ=0.5는 어떤 변환인가?
- λ=0: log(y) — 로그 변환 (우편향, 분산이 평균에 비례)
λ=0.5: √y — 제곱근 변환 (약한 우편향)
λ는 최대우도로 데이터에서 자동 추정 - Box-Cox 변환의 제약과 대안은?
- 양의 값에만 적용 가능 (y > 0 필수)
음수 포함 시: Yeo-Johnson 변환 사용
둘 다 멱변환(Power Transformation)의 일종