분류분석은 이미 분류된(레이블이 있는) 데이터를 바탕으로 새로운 데이터가 어느 그룹에 속할지 예측하는 지도학습 방법입니다. 신용등급 예측, 스팸메일 분류, 질병 진단 등이 대표적 사례입니다. "아파트 가격 예측"은 연속형 수치를 예측하는 회귀 문제이므로 분류분석이 아닙니다. 의사결정나무(Decision Tree)는 데이터를 특정 기준으로 반복적으로 분할하여 나무 형태의 구조를 만드는 방법입니다. 분할 기준으로 지니지수(Gini Index)나 엔트로피(Entropy)를 사용하며, 자식 마디의 순수도(한 범주의 비율)가 최대가 되도록 분류합니다. 지니지수는 1-Σ(Pᵢ²)로 계산하며, 값이 작을수록 순수합니다(CART 알고리즘 사용). 엔트로피는 -Σ(Pᵢ × log₂Pᵢ)로 계산하며, 값이 0에 가까울수록 순수하고 1에 가까울수록 불순합니다(C4.5 알고리즘 사용). 정보이득(Information Gain)은 분기 전후의 엔트로피 감소량으로, 정보이득이 클수록 좋은 분할 기준입니다. 가지치기(Pruning)는 과적합을 방지하기 위해 불필요한 가지를 제거하는 것으로, 학습 데이터에서의 정확도는 오히려 낮아질 수 있지만 일반화 성능은 향상됩니다. 로지스틱 회귀는 종속변수가 범주형(예: 성공/실패, 합격/불합격)일 때 사용하는 분류 모델입니다. 시그모이드(Sigmoid) 함수를 사용하여 출력값을 0과 1 사이로 변환합니다. 로지스틱 회귀에서 오즈(Odds) = P(Y=1)/P(Y=0)로, 사건이 발생할 확률을 발생하지 않을 확률로 나눈 비율입니다. 회귀계수 β의 오즈비(Odds Ratio) = exp(β)는 설명변수가 1단위 증가할 때 오즈가 변화하는 배율을 의미합니다. 오즈비가 1보다 크면 양의 영향(사건 발생 확률 증가), 1보다 작으면 음의 영향을 의미합니다. 즉 오즈는 "비율 자체"이고, 오즈비는 "X 변화에 따른 오즈의 증가 배율"입니다. 인공신경망(ANN)은 인간 뇌의 뉴런 구조를 모방한 모델로, 입력층-은닉층-출력층으로 구성됩니다. 은닉층이 없으면 로지스틱 회귀와 동일하게 작동합니다. 활성화 함수로는 시그모이드(출력 01), ReLU(입력이 양수면 그대로, 음수면 0), 하이퍼볼릭 탄젠트(출력 -11), 소프트맥스(다중 클래스 분류 시 사용) 등이 있습니다. 가중치 개수는 (이전 층 노드 수 × 다음 층 노드 수)의 합으로 계산합니다. 핵심 요약 & 시험 포인트 의사결정나무 분할 기준 비교 기준 수식 특징 지니지수 1-Σ(Pᵢ²) 0에 가까울수록 순수, CART 알고리즘 엔트로피 -Σ(Pᵢ×log₂Pᵢ) 0=완전 순수, 1=완전 불순, C4.5 알고리즘 정보이득 분기 전 엔트로피 - 분기 후 엔트로피 클수록 좋은 분할 시험 포인트: 가지치기(Pruning)는 학습 데이터 정확도를 낮추더라도 일반화 성능을 높이는 것이 목적입니다. 오즈(Odds) vs 오즈비(Odds Ratio) 개념 수식 의미 오즈(Odds) P(Y=1)/P(Y=0) 발생 확률÷비발생 확률 오즈비(Odds Ratio) exp(β) X가 1단위 증가할 때 오즈가 변화하는 배율 시험 포인트: "설명변수가 1단위 증가할 때 오즈의 증가율"은 오즈비(exp(β))입니다. 오즈 자체가 아님에 주의! 활성화 함수 비교 함수 출력 범위 용도 시그모이드 01 이진 분류(출력층), 로지스틱 회귀와 동일 ReLU 0 또는 입력값 은닉층 (기울기 소실 방지) 하이퍼볼릭 탄젠트 -11 은닉층 소프트맥스 합=1 다중 클래스 분류(출력층) SVM (Support Vector Machine) SVM은 두 클래스를 분리하는 초평면(Hyperplane) 중 마진(Margin)이 최대가 되는 평면을 찾는 분류 기법입니다. 💡 한 줄 직관: 두 그룹 사이에 가장 넓은 도로(마진)를 긋는다. 도로의 가장자리(갓길)에 정확히 닿는 점들이 서포트 벡터(Support Vector), 도로의 한가운데를 지나는 가상의 선이 초평면(Hyperplane). 핵심 4개념 (그림과 함께) 개념 그림에서의 위치 한 줄 정의 초평면(Hyperplane) 가운데 두꺼운 검은 선 (w·x − b = 0) 두 그룹을 가르는 결정 경계 마진(Margin) 두 점선 사이의 폭 (2 / ‖w‖) 초평면과 가장 가까운 점까지의 거리 ×2 서포트 벡터 점선 위에 동그라미로 표시된 점들 마진을 결정하는 경계점. 이 점들만 모델에 영향을 줌 최대 마진 SVM의 목표 마진을 최대화 = ‖w‖를 최소화 시험 포인트: 서포트 벡터가 아닌 점은 위치가 바뀌어도 결과가 바뀌지 않는다. SVM은 "경계의 몇 점"만으로 결정되는 모델. 하드 마진 vs 소프트 마진 종류 오분류 허용 사용 상황 하드 마진(Hard Margin) 0개 데이터가 깔끔히 선형 분리 가능할 때 (현실에서 드묾) 소프트 마진(Soft Margin) 일부 허용 (슬랙 변수 ξ + 비용 C) 노이즈·중첩이 있는 현실 데이터. 실제로 항상 이것을 사용 - C(비용 파라미터): 클수록 오분류에 엄격(과적합 ↑) / 작을수록 마진을 크게(일반화 ↑) 커널 트릭 (Kernel Trick) — 비선형 분리 💡 직관: 책상 위에 빨간 동전과 파란 동전이 섞여서 직선으로 못 가르겠다면? 책상을 흔들어 빨간 동전만 살짝 들어올린 뒤 그 사이를 손으로 가른다. 차원을 한 단계 올리면 분리되지 않던 데이터도 평면 하나로 분리될 수 있다. 수학적으로는 원본 공간 → 고차원 특징 공간으로 매핑하지만, 실제로 매핑하지 않고 내적만 계산(트릭). 대표 커널 3종 커널 수식 사용 시점 선형(Linear) K(x,y) = x·y 데이터가 거의 선형 분리 가능, 변수 수 ≫ 데이터 수 다항(Polynomial) K(x,y) = (x·y + c)^d 변수 간 곱셈 형태의 상호작용 RBF(Gaussian) K(x,y) = exp(−γ‖x−y‖²) 기본값·가장 많이 사용. 비선형 일반 데이터 - γ(감마): 클수록 결정 경계가 데이터를 촘촘히 감싸며 굽음(과적합 ↑) SVM 장단점 요약 장점 단점 고차원·복잡한 패턴에 강함 대용량 데이터에 느림 (O(n²)O(n³)) 서포트 벡터 기반 → 메모리 효율적 확률값 출력이 기본 아님 (Platt scaling 필요) 커널로 비선형 문제 해결 변수 스케일링 필수 (거리 기반) 일반화 성능 우수 커널·C·γ 등 하이퍼파라미터 튜닝 부담 시험 포인트 4가지 1. SVM의 목표 = 마진 최대화 2. 결과를 결정하는 것은 오직 서포트 벡터 3. 비선형 분리는 커널 트릭으로 해결 4. 스케일링(표준화) 필수 — 거리 기반이라 변수 단위가 결과를 좌우함 나이브 베이즈(Naive Bayes) 베이즈 정리를 기반으로 모든 특성이 조건부 독립이라고 가정하고 분류하는 확률 모델입니다. P(C X) ∝ P(C) × ∏ P(xᵢ C) 항목 설명 가정 특성들이 클래스 조건 하에 서로 독립 (현실에선 거의 X, 그래도 잘 동작) 장점 학습 속도 빠름, 적은 데이터로도 동작, 다중 클래스 단점 독립 가정이 틀리면 성능 저하 활용 스팸 필터, 문서 분류, 감성 분석 라플라스 스무딩 학습 데이터에 없던 단어의 확률을 0으로 처리하지 않게 +1 보정 KNN (K-Nearest Neighbors) KNN은 새로운 데이터의 클래스를 가장 가까운 K개 이웃의 다수결로 결정하는 거리 기반 분류 기법입니다. 항목 설명 K 값 작으면 과적합(노이즈에 민감), 크면 과소적합 거리 척도 유클리드, 맨하탄, 민코프스키 게으른 학습 학습 단계 없음, 예측 시 전체 탐색 표준화 필수 변수 스케일 차이가 거리에 영향 시험 포인트: KNN은 모델을 만들지 않고 데이터 자체를 "기억"합니다(Lazy Learning). 변수 정규화/표준화가 필수. 신경망 학습 — 순전파·역전파·경사하강법 단계 설명 순전파(Forward) 입력→은닉→출력층으로 값 전달, 손실 계산 역전파(Backpropagation) 출력층→입력층으로 가중치별 기울기를 연쇄법칙으로 전달 경사하강법(Gradient Descent) 기울기의 반대 방향으로 가중치 업데이트 경사하강법 변형 - SGD: 1개 샘플로 갱신, 빠르지만 불안정 - Mini-batch GD: 작은 배치 단위, 가장 일반적 - Momentum: 이전 갱신 방향 누적 - Adam: Momentum + RMSProp, 자주 사용 기울기 소실(Vanishing Gradient): 시그모이드/Tanh 사용 시 깊은 신경망에서 기울기가 0에 가까워지는 문제. ReLU 도입으로 완화됨. 의사결정나무 알고리즘 비교 알고리즘 분할 기준 입력 변수 분기 ID3 정보이득 (엔트로피) 범주형만 다지 C4.5 정보이득비 범주형+연속형 다지 CART 지니지수(분류) / 분산감소(회귀) 범주형+연속형 이진 CHAID 카이제곱 / F검정 범주형 다지 (통계적 유의성) 시험 포인트: CART는 항상 이진 분기. CHAID는 통계 검정으로 유의한 분기만 수행. ID3는 범주형만 처리 가능. 의사결정나무 — 사전 가지치기 vs 사후 가지치기 종류 시점 방법 장단점 사전 가지치기 (Pre-pruning) 트리 성장 중 정지 조건 설정 빠름, 너무 일찍 멈출 위험 사후 가지치기 (Post-pruning) 완전 트리 생성 후 가지 제거하며 검증 성능↑, 비용 큼 사전 가지치기 정지 조건 - 최대 깊이(maxdepth): 트리 깊이 제한 - 최소 분할 샘플(minsamplessplit): 분할에 필요한 최소 데이터 - 최소 리프 샘플(minsamplesleaf): 리프 노드 최소 데이터 - 최소 정보이득: 분할의 정보이득 임계값 사후 가지치기 방법 - 비용복잡도 가지치기 (Cost-Complexity Pruning, CCP): - α 파라미터로 모형의 복잡도(트리 크기) vs 정확도 trade-off 결정 - α↑ → 가지치기 강함 → 작은 트리 - 교차검증으로 최적 α 선택 - Reduced Error Pruning: 검증 세트로 가지 제거 시 성능 평가 시험 포인트: 사후 가지치기가 일반적으로 더 좋은 성능. 사전은 계산이 빠르지만 너무 일찍 멈출 수 있음. 가지치기의 목적은 과적합 방지·일반화 성능 향상. 추가 핵심 개념 — 딥러닝 신경망 심화 - 활성화 함수 비교: - Sigmoid σ(z) = 1/(1+e⁻ᶻ): [0,1], 이진 분류 출력층. 단점: 큰 z 에서 기울기 소실 - Tanh: [-1,1], 0 중심으로 학습 안정성↑ - ReLU max(0, z): [0,∞), 은닉층 표준. 단점: 죽은 ReLU(Dying ReLU) - Softmax: 다중 분류 출력층(합=1로 정규화). 교차엔트로피 손실과 결합 - 학습 하이퍼파라미터: - 학습률(Learning Rate, η): 너무 크면 발산, 너무 작으면 수렴 느림. Adam·RMSProp은 적응적 학습률 사용 - 드롭아웃(Dropout): 학습 시 뉴런 일부 무작위 비활성화(p=0.20.5)로 과적합 완화 - 배치 정규화(Batch Normalization): 각 층 입력의 분포를 정규화해 학습 가속·일반화 - 딥러닝 아키텍처: - CNN(Convolutional NN): 합성곱(Convolution) + 풀링(Pooling)으로 공간적 특징 추출. 이미지·영상 인식 - RNN(Recurrent NN): 순환 구조로 시계열·텍스트 처리. 기울기 소실 문제 - LSTM(Long Short-Term Memory): 셀 상태 + 3개 게이트(입력·망각·출력)로 RNN의 기울기 소실 해결. 장기 의존성 학습 가능 - GRU(Gated Recurrent Unit): LSTM의 단순화 버전(2개 게이트) - Transformer: Attention 기반. 현재 NLP·시계열에서 RNN/LSTM 대체. BERT·GPT의 기반 - Autoencoder: 입력 → 인코더 → 잠재공간 → 디코더 → 입력 복원. 차원축소·이상탐지·생성 모델 - GAN(Generative Adversarial Network): 생성자(Generator) vs 판별자(Discriminator)가 경쟁 학습. 이안 굿펠로우(2014) - 전이학습(Transfer Learning): 사전학습 모델(ImageNet·BERT)의 가중치를 새 도메인 데이터로 추가 학습(파인튜닝). 소규모 데이터에서도 효과적 - k-NN(k-Nearest Neighbors): 게으른 학습(Lazy Learning) — 학습 단계에서 모델을 만들지 않고 예측 시 가장 가까운 k개 이웃의 다수결로 분류. 거리 기반이므로 정규화 필수. k가 작으면 과적합·노이즈 민감, k가 크면 과소적합 시험 핵심: 활성화 함수별 출력 범위·용도, 드롭아웃·배치 정규화의 정규화 효과, CNN/RNN/LSTM/GRU/Transformer의 적용 영역은 딥러닝 단원의 빈출 포인트입니다. 인공신경망 심화 - 퍼셉트론(Perceptron): 신경망의 최소 단위. 입력 가중합 → 활성화 함수 - 은닉층(Hidden Layer) / 입력층 / 출력층: 신경망의 3대 층 구성 - 활성화 함수(Activation Function): - 시그모이드(sigmoid): 01, 이진분류 출력층, gradient vanishing 문제 - tanh: −11, 시그모이드보다 학습 안정 - ReLU: max(0, x), 가장 널리 사용, gradient vanishing 완화 - softmax: 다중분류 출력층, 클래스 확률 합 = 1 - 역전파(Backpropagation): 출력에서 입력 방향으로 오차를 전파해 가중치 갱신 - 경사하강법(Gradient Descent): 손실함수 미분으로 가중치 업데이트 - 확률적 경사하강법(SGD): 미니배치 단위 경사하강 — 계산 빠르고 일반화 좋음 - 옵티마이저(Optimizer): Adam, RMSProp, AdaGrad 등. Adam이 가장 보편 - 드롭아웃(Dropout): 학습 시 일부 뉴런 무작위 비활성화 — 과적합 완화 - 배치 정규화(Batch Normalization): 층별 입력을 정규화해 학습 안정·가속 SVM (서포트 벡터 머신) - 마진(Margin): 결정경계와 가장 가까운 데이터(서포트 벡터) 사이 거리 — 마진을 최대화 - 커널(Kernel): 비선형 분류를 위해 데이터를 고차원으로 매핑하는 함수 - 선형(linear) / 다항(polynomial) / RBF(가우시안) / 시그모이드 - C 파라미터: 마진 위반 허용 정도 — 클수록 과적합, 작을수록 일반화 분류 임계값(Threshold/Cutoff) - 로지스틱·확률 기반 분류기는 기본 0.5에서 결정 — 비용 불균형 시 조정 - 임계값을 낮추면 민감도(재현율)↑·특이도↓, 높이면 그 반대 의사결정나무 알고리즘 계열 - ID3 (Iterative Dichotomiser 3): 정보이득(Information Gain) 기준, 범주형 변수만 지원 - C4.5: ID3의 후속 — 이득률(Gain Ratio) 사용, 연속형·결측치 지원 - C5.0: C4.5 개선판 — 더 빠르고 메모리 효율적, 부스팅 내장 - CART(Classification and Regression Tree): 지니지수(분류)·MSE(회귀) 기준, 이진 분할만 사용 - CHAID(Chi-squared Automatic Interaction Detection): 카이제곱 검정으로 다중 분할 학습 제어 - 조기 종료(Early Stopping): 검증 손실이 일정 횟수 개선되지 않으면 학습 중단 — 과적합 방지 - 학습률(Learning Rate): 가중치 갱신 보폭 — 너무 크면 발산, 너무 작으면 수렴 느림 - 에폭(Epoch): 전체 학습 데이터를 한 번 통과한 단위 - 배치 크기(Batch Size): 한 번의 가중치 갱신에 사용되는 표본 수 (1=SGD, 전체=배치 GD, 그 사이=미니배치) - 학습 곡선(Learning Curve): 학습량 대비 학습/검증 손실 — 편향·분산 진단 - 검증 곡선(Validation Curve): 하이퍼파라미터 값 대비 학습/검증 성능 하이퍼파라미터 탐색 - 하이퍼파라미터(Hyperparameter): 학습 전에 사람이 정하는 모델 설정값 (학습률·트리 깊이·k 등) - 그리드 서치(Grid Search): 미리 정한 격자점을 모두 탐색 — 차원 저주 - 랜덤 서치(Random Search): 임의 샘플링 — 동일 시간 대비 그리드보다 우수한 경우 많음 - 베이지안 최적화(Bayesian Optimization): 이전 시도 결과로 다음 후보를 똑똑하게 선택 (Gaussian Process·TPE) 의사결정나무 분할 기준 - 지니불순도(Gini Impurity): 1 − Σpᵢ². 작을수록 순수. CART의 기본 - 엔트로피(Entropy): −Σpᵢ·log₂pᵢ. 정보이론 기반 - 정보획득(Information Gain): 분할 전 엔트로피 − 분할 후 가중 엔트로피 - 이득률(Gain Ratio): 정보획득을 분할정보(SplitInfo)로 정규화 — C4.5 가지치기 (Pruning) - 사전 가지치기(Pre-pruning): 트리 성장 중 조기 중단 (최대 깊이·최소 샘플 등 제약) - 사후 가지치기(Post-pruning): 완전 성장 후 검증 성능이 떨어지는 가지 제거 — 비용복잡도 가지치기 판별분석 (Discriminant Analysis) - 선형판별분석(LDA): 공통 공분산행렬 가정 → 선형 결정경계 - 이차판별분석(QDA): 각 클래스 공분산행렬이 다름 → 곡선 결정경계 — 더 유연하나 파라미터 많음 분류 평가 추가 - ROC Curve: 임계값 변화에 따른 (1−특이도, 민감도) 궤적 - 임곗값(Cut-off): 확률을 양/음으로 가르는 기준값 - 오류율(Error Rate): (FP+FN)/전체 = 1 − Accuracy - 양성 예측도(PPV) = Precision, 음성 예측도(NPV) = TN/(TN+FN) 신경망 추가 - MLP(Multi-Layer Perceptron, 다층 퍼셉트론): 1개 이상의 은닉층을 가진 피드포워드 신경망 — 비선형 분류·회귀의 기초 - ELU / GELU: 활성화 함수 변종 — ELU는 음수 영역에서 부드러운 곡선, GELU는 Gaussian 기반 (BERT·GPT 사용) - Mini-Batch: 학습 데이터를 작은 묶음(보통 32·64·128·256)으로 나눠 가중치 갱신 — SGD와 배치 GD의 절충 - Saliency Map: 입력 변수가 예측에 미친 영향을 시각화 — XAI 기법 베이지안 네트워크 - DAG(Directed Acyclic Graph, 방향 비순환 그래프): 베이지안 네트워크·인과추론의 기본 구조 의사결정나무 용어 추가 - 단말 노드(Terminal Node) / 잎 노드(Leaf Node): 더 이상 분할되지 않는 최종 노드 - 분할정보(Split Information): 이득률 계산의 분모 분류 문제 유형 - 이진 분류(Binary Classification): 두 클래스 (양성/음성) - 다항분류 / 다중 클래스(Multi-class Classification): 세 클래스 이상의 단일 라벨 - 다중 라벨(Multi-label): 한 샘플에 여러 라벨 - OvR(One-vs-Rest) / OvA(One-vs-All): K개 클래스를 K개 이진 분류기로 분해 - OvO(One-vs-One): 두 클래스씩 쌍별 이진 분류 → K(K−1)/2개 분류기 불균형 데이터 처리 - Imbalanced Data: 클래스 비율이 크게 다른 데이터 — 정확도가 무의미해짐 - 양성 클래스(Positive Class) / 음성 클래스(Negative Class): 보통 관심 대상이 양성 (불량·사기·질환) - 기준선(Baseline) / 기준 모형(Naive Baseline): 최빈 클래스 예측·임의 추측 등 단순 기준 — 모델 성능 평가의 출발점 신경망 학습 심화 - 역전파 알고리즘(Backpropagation): 출력층 오차를 입력 방향으로 전파해 모든 가중치의 기울기를 효율 계산 → 가중치 갱신 - Vanishing Gradient(기울기 소실): 깊은 신경망에서 역전파 시 기울기가 0에 수렴 → 학습 정체 - 원인: sigmoid·tanh의 작은 미분값이 곱해지며 사라짐 - 해결: ReLU·잔차 연결(Residual)·LSTM·배치정규화 - Exploding Gradient(기울기 폭주): 기울기가 발산 → 가중치 발산 - 해결: Gradient Clipping(기울기 절단) 가중치 초기화 - Xavier 초기화 / Glorot 초기화: 입력·출력 차원에 따른 정규분포 초기화 — sigmoid·tanh에 적합 - He 초기화: ReLU에 적합, 입력 차원 기반 - 0 초기화는 학습 불가(대칭성 문제), 너무 큰 값은 발산 정규화 기법 (Regularization) - L1 Regularization: w 의 합을 페널티 — 희소 해(일부 가중치 0) - L2 Regularization / Weight Decay: w²의 합을 페널티 — 매끄러운 작은 가중치 - Elastic Net: L1 + L2 결합 비지도 신경망 - 오토인코더(Autoencoder): Encoder → 잠재공간 → Decoder, 입력 복원 — 차원축소·이상탐지·노이즈 제거 의사결정나무 노드 구조 - 뿌리 노드(Root Node): 트리의 시작점 — 전체 데이터를 포함 - 내부 노드(Internal Node): 분기가 일어나는 중간 노드 - 잎/단말 노드(Leaf/Terminal Node): 더 이상 분할되지 않는 끝 노드 — 최종 예측값을 가짐 - 분기 변수(Split Variable) / 분기 기준(Splitting Criterion) / 분리 기준: 노드를 나누는 변수와 그 임계값 - 복잡도(Complexity): 트리의 깊이·노드 수 — 과적합과 직결 활성화 함수 추가 변종 - Leaky ReLU: x < 0에서 작은 기울기(α≈0.01) 유지 — Dying ReLU 문제 완화 - Maxout: 여러 선형 변환 중 최댓값 선택 — 활성화를 학습 - Swish: x · sigmoid(x) — ReLU보다 부드러움, 성능 우수 - Mish: x · tanh(softplus(x)) 옵티마이저 계보 - SGD → Momentum → Nesterov → Adagrad → RMSProp → Adam → AdamW - Momentum(모멘텀): 이전 기울기를 누적 → 진동 감소·수렴 가속 - Nesterov: 모멘텀 적용 후의 위치에서 기울기 계산 - Adagrad / Adadelta: 변수별 학습률 자동 조정 - RMSProp: Adagrad의 학습률 감소 문제 완화 - Adam: Momentum + RMSProp 결합 — 가장 보편적 순/역전파 - 순전파(Forward Propagation): 입력 → 출력 방향의 계산 - 역전파(Backpropagation, 역방향 패스): 출력 오차 → 입력 방향으로 기울기 전파 손실 함수 추가 - Huber Loss: MAE와 MSE의 절충 — 작은 오차는 MSE, 큰 오차는 MAE, 이상치에 강건 - Focal Loss: 어려운 샘플에 집중하는 손실 — 불균형 데이터·객체 검출 Probit 회귀 - Probit Regression: 종속변수가 이진일 때 정규분포 누적함수를 연결함수로 사용 — 로지스틱과 유사하나 함수 형태 다름 의사결정나무 알고리즘 — ID3 - ID3(Iterative Dichotomiser 3) by Quinlan 1986 - 분기 기준: 정보획득(Information Gain) - 한계: 연속형 변수·결측치 처리 부족, 다지 분기로 과적합 경향 - C4.5: ID3의 후속 — 이득률(Gain Ratio)·연속형·결측 지원 - C5.0 / CART / CHAID: 후속 진화 신경망 발전사 - 단일 퍼셉트론(Single-layer Perceptron): 입력 → 출력 직접 연결 — Rosenblatt 1958 - 단일 퍼셉트론의 한계: 선형 분리 가능한 문제만 학습 가능, XOR 문제 해결 불가 (Minsky & Papert 1969) - 다층 퍼셉트론(MLP): 은닉층 추가로 비선형 문제 해결 — XOR도 학습 가능 - 신경망의 학습: 순전파로 예측 → 손실 계산 → 역전파로 기울기 → 옵티마이저로 가중치 갱신, 반복 CNN 구성요소 - Feature Map(특성맵): 합성곱·풀링 후 만들어지는 중간 표현 — 입력의 특정 패턴을 강조 - Filter(필터/커널): 합성곱에 사용되는 작은 행렬 — 학습되는 가중치 - Stride: 필터가 이동하는 간격 - Padding: 입출력 크기 조정을 위한 가장자리 채우기 - Pooling: Max/Average Pooling — 차원 축소·이동 불변성 RNN/LSTM 구성요소 - Cell State: LSTM의 장기 기억 — 시간을 통해 흐르며 정보 유지 - Hidden State: 단기 기억 / 출력 - Gate: Input/Forget/Output 게이트 — 정보의 흐름 제어 - Input Gate: 새 정보를 셀에 얼마나 추가할지 - Forget Gate: 기존 정보를 얼마나 잊을지 - Output Gate: 셀에서 얼마나 출력할지 결정 임계값 (Decision Threshold) - 결정 임계값(Decision Threshold / Cut-off): 확률을 양/음 클래스로 가르는 기준값 (보통 0.5) - 임계값 ↓: 더 많은 양성 예측 → Recall ↑, Precision ↓ (놓치면 안 되는 의료·암 진단) - 임계값 ↑: 더 적은 양성 예측 → Precision ↑, Recall ↓ (거짓 양성 비용 큰 스팸·추천) - PR/ROC 곡선으로 임계값별 성능 시각화 → 비즈니스 목적에 맞춰 선택 의사결정나무 핵심 하이퍼파라미터 - maxdepth: 트리의 최대 깊이 — 클수록 복잡·과적합 - minsamplessplit: 노드 분할에 필요한 최소 샘플 수 - minsamplesleaf: 잎 노드가 가져야 할 최소 샘플 수 - maxleafnodes: 최대 잎 노드 수 - ccpalpha(비용복잡도 가지치기 파라미터): 클수록 가지치기 강함 - 가지치기·최대 깊이 제한이 과적합 방지의 핵심 SVM 커널 종류 - Linear SVM(선형 커널): 선형 분리 가능한 경우 — K(x, y) = x·y - Polynomial SVM(다항 커널): K(x, y) = (γx·y + r)^d — 다항식 특성공간으로 매핑 - RBF SVM(가우시안 커널): K(x, y) = exp(−γ‖x−y‖²) — 가장 보편적, 무한차원 매핑 - Sigmoid SVM: 신경망과 유사한 활성화 형태 결정 함수와 영역 - 결정 함수(Decision Function): 모델이 출력하는 점수·확률 - 결정 영역(Decision Region): 같은 클래스로 분류되는 입력 공간의 영역 - 결정 경계(Decision Boundary): 클래스가 바뀌는 경계 의사결정나무 규칙 - 분리규칙(Splitting Rule): 노드를 어떻게 나눌지 — Gini·Entropy·Gain Ratio - 정지규칙(Stopping Rule): 더 이상 분할하지 않는 조건 — 최소 샘플·최대 깊이·불순도 임계 - 정보이득률(Gain Ratio): 정보획득을 분할정보로 나눠 정규화 — C4.5에서 사용 - 지니 불순도(Gini Impurity, CART): 1−Σpᵢ² — CART의 기본 비모수 모형 - 비모수 모형(Non-parametric Model): 모수의 수가 고정되지 않고 데이터 크기에 따라 증가 — KNN·의사결정나무·SVM(RBF)·신경망 인공신경망 이론 - Universal Approximation Theorem(근사 정리): 단일 은닉층 신경망도 충분한 뉴런이 있으면 임의의 연속함수를 근사 가능 — 신경망의 이론적 기초 CNN/DL 추가 개념 - 완전연결(Dense / Fully Connected) 층: 이전 층의 모든 뉴런과 연결 - 데이터 증강(Data Augmentation): 회전·반전·노이즈 추가로 학습 데이터를 인공적으로 늘림 — 과적합 완화 - 사전학습(Pre-training): 대규모 일반 데이터로 먼저 학습 후 특정 과제에 전이 - 동결 해제(Gradual Unfreezing): 전이학습 시 사전학습 가중치를 단계적으로 학습 가능하게 풀어줌 - Inverted Dropout: 학습 시 활성화에 1/(1−p)를 곱해 추론 시 가중치 조정 불필요한 Dropout 변형 - 이미지 분할(Segmentation): 픽셀 단위로 영역을 분류 — U-Net·Mask R-CNN SOM의 창시자 - Teuvo Kohonen(1982): 자기조직화지도(SOM, Kohonen Map)의 창시자 로컬·전역 최적 - Local Optimum(지역 최적): 주변보다는 좋지만 전체 최적이 아닌 해 - Global Optimum(전역 최적): 모든 해 중 최적 - Saddle Point(안장점): 한 방향으로는 최소, 다른 방향으로는 최대 — 신경망 학습에 자주 등장 확률 보정 (Probability Calibration) - 확률 보정(Calibration): 모델이 출력하는 확률값이 실제 빈도와 일치하도록 조정 - Platt Scaling: 출력 점수에 로지스틱 회귀 적합 — SVM·트리 모델의 확률 보정에 사용 - Isotonic Regression(아이소토닉 회귀): 단조 비감소 함수로 점수를 확률에 매핑 — 비모수 보정 - Calibration Plot: 예측 확률(x)과 실제 빈도(y) 비교 — 대각선에 가까울수록 잘 보정됨 - Brier Score: 보정도 종합 평가 지표 임곗값 조정 - Threshold Moving(임곗값 이동): 비용·불균형에 따라 결정 임계값을 0.5에서 다른 값으로 조정 - 불균형 데이터·비대칭 비용·도메인 요구사항에 맞춰 최적 임곗값 탐색 단일 클래스 SVM - One-Class SVM: 한 클래스(정상)만 학습 → 이상 탐지에 활용 - 사기 탐지·고장 감지·침입 탐지에서 사용 — 양성 데이터만 존재하는 경우 Soft / Hard Margin - Hard Margin SVM: 모든 학습 데이터를 마진 밖에 두는 엄격한 분리 — 선형 분리 가능 데이터에만 - Soft Margin SVM: 일부 위반 허용, 슬랙 변수(여유 변수, ξ) 도입 - C 파라미터: 위반 페널티 — C ↑ → Hard, C ↓ → Soft (더 관대) XAI 시각화 기법 - Grad-CAM(Gradient-weighted Class Activation Mapping): CNN의 마지막 합성곱 층의 그래디언트로 중요 영역 시각화 - Saliency Map: 입력 변수가 예측에 미친 영향의 절댓값을 시각화 - Integrated Gradients: 입력 경로를 따라 기울기를 적분 — 노이즈 적음 CAP Curve - CAP(Cumulative Accuracy Profile) Curve: 모델이 잡아내는 양성 누적 비율 - x축: 전체 데이터 중 선택 비율 - y축: 잡아낸 양성 누적 비율 - 완벽 모델 ↔ 무작위 모델 사이의 면적 비율(Accuracy Ratio)로 평가 베이지안 네트워크 - 베이지안 네트워크(Bayesian Network) / BBN: 변수 간 조건부 의존성을 DAG로 표현 - Belief Network: 베이지안 네트워크의 동의어 - 활용: 의료 진단·고장 진단·인과 추론 메타휴리스틱 최적화 알고리즘 - 메타휴리스틱(Metaheuristic): 일반적인 최적화 문제를 해결하는 휴리스틱의 상위 개념 — 문제 특성에 의존하지 않는 범용 전략 - 유전 알고리즘(GA, Genetic Algorithm): 다윈의 자연선택을 모방한 진화 기반 최적화 — 존 홀랜드(John Holland, 1975) 개발 - 절차: 초기 해집단(Population) → 적합도(Fitness) 평가 → 선택(Selection) → 교차(Crossover, 교배) → 돌연변이(Mutation) → 세대 반복 - 유전자(Gene) / 염색체(Chromosome): 해(solution)의 부호화 - 적자생존(Survival of the Fittest) 원리 - 선택 방식: 룰렛휠(Roulette Wheel), 토너먼트(Tournament), 순위 기반 - 입자 군집 최적화(PSO, Particle Swarm Optimization): 새 떼·물고기 떼의 군집 행동을 모방 — 입자들이 개인 최적과 군집 최적을 향해 이동 - 시뮬레이션 어닐링(Simulated Annealing, SA) / 담금질 기법: 금속 담금질 과정 모방 — 온도를 점진적으로 낮추며 국소 최적 탈출 - 개미 군집 최적화(Ant Colony Optimization, ACO): 페로몬 trail을 통한 협력 탐색 - 타부 탐색(Tabu Search): 최근 방문 해를 금지 목록에 추가해 순환 방지 - 유전 프로그래밍(Genetic Programming, GP): GA를 프로그램·식 자체에 적용 신경망 잔차 연결 - Residual Connection(잔차 연결) / Skip Connection: ResNet의 핵심 — 입력을 출력에 직접 더해줌 (y = F(x) + x) - Highway Network: 게이트가 잔차 연결을 동적으로 조절 - 효과: Vanishing Gradient 완화, 매우 깊은 네트워크 학습 가능 강화학습 추가 알고리즘 - SARSA(State-Action-Reward-State-Action): On-policy TD 학습 — 실제 다음 행동으로 업데이트 - Q-Learning vs SARSA: Off-policy(최대 Q값으로 업데이트) vs On-policy(실제 정책 행동으로 업데이트) - On-policy / Off-policy: 학습 정책과 행동 정책의 일치 여부 CNN 층 명칭 한글 - 컨볼루션층(Convolution Layer): 필터로 합성곱 — 특성 추출 - 풀링층(Pooling Layer): Max/Average Pooling — 차원 축소·이동 불변성 - 완전연결층(Fully Connected Layer): 모든 뉴런 연결 — 분류·회귀 출력 - 드롭아웃층(Dropout Layer): 학습 시 무작위 뉴런 비활성화 — 과적합 완화 - 배치 정규화층(Batch Normalization Layer): 층별 입력 정규화 — 학습 안정화·가속 학습 가능 파라미터 - 학습 가능한 파라미터(Trainable / Learnable Parameter): 학습 과정에서 갱신되는 가중치·편향 - 예: CNN의 필터·완전연결층의 가중치·BN의 γ/β - 비학습 파라미터: BN의 통계량(러닝 평균/분산) — 학습 중 누적되지만 기울기 갱신 안 됨 - 모델 크기는 보통 학습 가능 파라미터 수로 표현 (예: GPT-3 175B) 판별 모델 vs 생성 모델 - Discriminative Model(판별 모델): P(Y X) 직접 학습 — 로지스틱·SVM·신경망 - Generative Model(생성 모델): P(X, Y) 또는 P(X) 학습 — 나이브 베이즈·GAN·VAE - 판별: 분류 성능 우수, 생성: 데이터 생성·이상 탐지 베이즈 최적 분류기 - Bayes Optimal Classifier: 진짜 P(Y X)를 안다고 가정할 때의 이론적 최적 분류기 - Bayes Risk(베이즈 위험): 베이즈 최적 분류기의 오류율 — 도달 가능한 최저 오류율 - 실제 모델의 오류율 = Bayes Risk + 추정 오차 + 최적화 오차 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - softmax — 다중분류 출력층, 클래스 확률 합 = 1 - 확률적 경사하강법 — 미니배치 단위 경사하강 — 계산 빠르고 일반화 좋음 - 옵티마이저 — Adam, RMSProp, AdaGrad 등. Adam이 가장 보편 - 배치 정규화 — 층별 입력을 정규화해 학습 안정·가속 - C5.0 — C4.5 개선판 — 더 빠르고 메모리 효율적, 부스팅 내장 - 배치 크기 — 한 번의 가중치 갱신에 사용되는 표본 수 (1=SGD, 전체=배치 GD, 그 사이=미니배치) - 학습 곡선 — 학습량 대비 학습/검증 손실 — 편향·분산 진단 - 검증 곡선 — 하이퍼파라미터 값 대비 학습/검증 성능 - 오류율 — (FP+FN)/전체 = 1 − Accuracy - 양성 예측도= Precision — , 음성 예측도(NPV) = TN/(TN+FN) - ELU / GELU — 활성화 함수 변종 — ELU는 음수 영역에서 부드러운 곡선, GELU는 Gaussian 기반 (BERT·GPT 사용) - OvR(One-vs-Rest) / OvA(One-vs-All) — K개 클래스를 K개 이진 분류기로 분해 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.
분류분석 — 의사결정나무·로지스틱 회귀·인공신경망
과목: 데이터 분석 (3과목, 8번 주제) ·
키워드: 기술통계 · 확률분포 · 로지스틱 회귀 · 의사결정나무 · 인공신경망 · 모형 평가 · 교차검증 · 과적합 · R 프로그래밍 · 데이터 전처리 · 텍스트 마이닝 · 확률 · 거리 측정 · 활성화 함수 · 강화학습·지도학습 · 분류 임계값
정의: 분류분석은 이미 분류된(레이블이 있는) 데이터를 바탕으로 새로운 데이터가 어느 그룹에 속할지 예측하는 지도학습 방법입니다.
핵심 Q&A (13개)
- 지니지수 vs 엔트로피의 차이는?
- 지니지수: 1-Σ(Pᵢ²), 작을수록 순수, CART 알고리즘
엔트로피: -Σ(Pᵢ×log₂Pᵢ), 0=완전순수, C4.5 알고리즘 - 가지치기(Pruning)의 목적은?
- 과적합 방지, 일반화 성능 향상
학습 데이터 정확도는 낮아질 수 있지만 테스트 성능은 향상 - 오즈(Odds) vs 오즈비(Odds Ratio)의 차이는?
- 오즈: P(Y=1)/P(Y=0) (비율 자체)
오즈비: exp(β) (X 1단위 증가 시 오즈 변화 배율) - 활성화 함수별 출력 범위는?
- 시그모이드: 0~1
Tanh: -1~1
ReLU: 0 또는 입력값(양수)
Softmax: 합=1 (다중 분류) - 아파트 가격 예측은 분류분석인가?
- ❌ 아니다. 연속형 수치 예측이므로 회귀분석.
분류분석은 이산형 범주(스팸/정상, 합격/불합격 등)를 예측 - SVM의 마진(Margin)과 서포트 벡터란?
- 마진: 초평면과 가장 가까운 데이터까지의 거리
서포트 벡터: 마진 결정에 영향을 주는 경계상의 데이터 점
SVM은 마진 최대화 = 서포트 벡터까지 거리 최대화 - 나이브 베이즈의 핵심 가정은?
- 특성(변수)들이 클래스 조건 하에서 서로 독립 (조건부 독립)
현실에서는 거의 성립하지 않지만, 가정이 틀려도 분류 성능은 우수
스팸 필터, 문서 분류에 자주 사용 - KNN에서 K 값이 작을 때와 클 때 차이는?
- 작은 K (예: K=1): 과적합, 노이즈에 민감, 결정 경계 복잡
큰 K: 과소적합, 결정 경계 단순
표준화/정규화 필수 (변수 스케일이 거리에 영향) - 신경망 역전파(Backpropagation)란?
- 출력층에서 입력층 방향으로 손실의 기울기를 연쇄법칙(Chain Rule)으로 전달하여 각 가중치를 업데이트하는 알고리즘
경사하강법과 결합하여 신경망 학습의 표준이 됨 - 의사결정나무 — CART vs CHAID 차이는?
- CART: 지니지수(분류)/분산감소(회귀), 항상 이진 분기, 범주형+연속형
CHAID: 카이제곱/F검정, 다지 분기, 통계적 유의성 기반, 범주형 중심 - SVM 커널 종류 3가지는?
- 선형(Linear): x·y
다항(Polynomial): (x·y+c)^d
RBF(가우시안): exp(-γ‖x-y‖²) — 가장 많이 사용 - 사전 가지치기 vs 사후 가지치기 차이는?
- 사전(Pre-pruning): 트리 성장 중 정지 조건(최대 깊이 등) — 빠름, 너무 일찍 멈출 위험
사후(Post-pruning): 완전 트리 생성 후 가지 제거 — 성능 좋음, 비용 큼
사후가 일반적 - 비용복잡도 가지치기(Cost-Complexity)란?
- 사후 가지치기 방법. α 파라미터로 트리 크기와 정확도의 trade-off 조정
α↑: 가지치기 강함, 작은 트리
α↓: 가지치기 약함, 큰 트리
교차검증으로 최적 α 선택