# ADsP 데이터분석 준전문가 시험 학습노트 전문(全文) > https://adsp.todaycode.kr — 42개 핵심 주제 본문. AI 검색·답변 엔진 인용용. 총 42개 토픽. 3과목 구조. 생성일: 2026-10-01. --- ## 1과목 데이터 이해 ### 데이터의 정의와 분류 URL: https://adsp.todaycode.kr/study/1 태그: 데이터 유형, 데이터베이스, IoT·플랫폼, SQL 데이터란 "추론과 추정의 근거를 이루는 사실"이라는 사전적 정의를 가지고 있습니다. 아직 가공되지 않은 원시 상태의 숫자, 문자, 기호 등을 뜻하며, 그 자체로는 의미가 없지만 다른 데이터와의 상호관계 속에서 가치를 가질 수 있습니다. 예를 들어 "25"라는 숫자 자체는 아무 의미가 없지만, "오늘의 기온은 25도"라는 맥락이 붙으면 정보가 됩니다. 데이터는 성격에 따라 크게 정성적 데이터와 정량적 데이터로 나뉩니다. 정성적(Qualitative) 데이터는 수치로 측정하기 어려운 데이터입니다. 주관식 응답, SNS 텍스트, 기상특보 등이 여기에 해당하며, 저장하고 분석하는 데 상대적으로 많은 비용과 시간이 듭니다. 정량적(Quantitative) 데이터는 온도, 습도, 강우량처럼 숫자로 표현되는 정형 데이터입니다. 양이 많아도 저장과 분석이 비교적 용이합니다. 데이터는 저장 형태에 따라서도 세 가지로 구분됩니다. 정형 데이터는 관계형 데이터베이스의 테이블처럼 행과 열로 구조화된 데이터입니다. 엑셀 스프레드시트나 SQL 테이블이 대표적입니다. 반정형 데이터는 데이터의 구조에 대한 메타 정보를 함께 포함하고 있는 데이터로, HTML, XML, JSON 등이 해당됩니다. 비정형 데이터는 이미지, 동영상, 음성, 텍스트처럼 정해진 구조가 없는 데이터입니다. 시험에서 "HTML은 정형 데이터이다"라는 보기가 자주 등장하는데, HTML은 반정형 데이터이므로 틀린 설명입니다. 또한 IoT 기기에서 생성되는 로그 데이터도 반정형 데이터에 가깝습니다. --- --- ## 핵심 요약 & 시험 포인트 데이터란 **추론과 추정의 근거를 이루는 사실**(사전적 정의)로, 상호관계 속에서 가치를 가질 수 있으며 추정 및 예측을 위한 근거 자료입니다. | 구분 | 설명 | 예시 | |------|------|------| | **정성적 데이터** (Qualitative) | 수치 측정 어려움. 저장/분석에 많은 비용·시간 소요 | 주관식 응답, 기상특보, SNS 텍스트 | | **정량적 데이터** (Quantitative) | 수치 기반 정형 데이터. 대량이어도 저장/분석 용이 | 온도, 습도, 강우량, 풍속 | > 시험 포인트: HTML, XML, JSON 등은 **반정형 데이터**입니다. 이미지·동영상·텍스트 등은 **비정형 데이터**입니다. > 주의: **정성적/정량적 분류**와 **정형/반정형/비정형 분류**는 서로 독립적인 두 가지 분류 기준입니다. 정성적 데이터가 주로 비정형 형태를 띠지만, 정성적=비정형으로 단순 동일시하지 마세요. --- --- ## 데이터 유형 — 정량적 vs 정성적 | 유형 | 특징 | 예시 | |------|------|------| | **정량적(Quantitative)** | 수치로 측정·계산 가능 | 키, 몸무게, 매출, 횟수 | | **정성적(Qualitative)** | 언어·기호·범주로 표현 | 색상, 의견, 텍스트, 등급 | ### 정량적 데이터의 하위 분류 - **이산형(Discrete)**: 셀 수 있는 정수값 (학생 수, 자녀 수) - **연속형(Continuous)**: 셀 수 없는 실수값 (키, 시간) ### 정성적 데이터의 하위 분류 - **명목형(Nominal)**: 순서 없는 범주 (성별, 혈액형) - **순서형(Ordinal)**: 순서 있는 범주 (만족도 5단계) > **주의**: 정형/반정형/비정형 분류는 "데이터 구조"의 분류이고, 정량적/정성적 분류는 "데이터 본질"의 분류로 서로 다름. ### 자료 형태 분류 - **정성적(Qualitative) 자료**: 범주·속성·언어 — 명목·서열 척도 (예: 성별·혈액형·등급) - **정량적(Quantitative) 자료**: 수치 — 등간·비율 척도 (예: 키·점수·온도) - **이산형(Discrete)**: 셀 수 있는 값 (자녀 수·불량품 개수) - **연속형(Continuous)**: 연속된 실수값 (키·무게·시간) - **범주형(Categorical) vs 수치형(Numerical)**: 데이터 분석에서의 실무 구분 ### 데이터 파일 형식 - **정형 데이터**: 행·열 구조의 RDB·스프레드시트 - **반정형 데이터**: 스키마는 있으나 RDB는 아님 — XML·JSON·HTML·로그 - **비정형 데이터**: 구조 없음 — 이미지·동영상·텍스트·음성 - **표준 파일 형식**: - **CSV(Comma-Separated Values)**: 콤마 구분, 가장 보편적인 평문 표 형식 - **TSV**: 탭 구분 - **JSON**: 키-값 중심, 웹 API 표준 - **XML**: 태그 구조, SOAP·문서 교환 - **Parquet / Avro / ORC**: 컬럼 기반 빅데이터 형식 — 압축률·쿼리 효율 우수 ### 데이터 출처별 분류 - **내부 데이터(Internal Data)**: 조직 내부에서 생성된 데이터 — ERP·CRM·운영 로그·고객 정보 - **외부 데이터(External Data)**: 외부 기관·웹·SNS·구매 데이터 — 환경·시장·경쟁사 정보 - **기업 데이터**: 조직의 가치사슬 활동에서 생성·관리되는 모든 데이터 - **공공 데이터(Open Data) / 개방 데이터**: 정부·공공기관이 공개한 데이터 — data.go.kr - **원시 데이터(Raw Data)**: 가공·정제되기 전의 데이터 ### 구조별 분류 (영어 표현) - **정형(Structured Data)**: 행·열 구조 — RDB·스프레드시트 - **반정형(Semi-Structured)**: 스키마는 있으나 비관계형 — XML·JSON·HTML·로그 - **비정형(Unstructured) / 비구조적**: 구조 없음 — 텍스트·이미지·음성·동영상 ### 유형별 데이터 (분석 관점) - **테이블 데이터(Tabular Data)**: 행·열로 표현된 정형 데이터 — 대부분의 ML 알고리즘 기본 입력 - **그래프 데이터(Graph Data)**: 노드·엣지로 표현된 관계 데이터 — SNS·지식그래프 - **이미지 데이터**: 픽셀 격자 — CNN으로 처리 - **동영상 데이터**: 시간축이 추가된 이미지 시퀀스 - **음성 데이터**: 1차원 시계열 신호 — 스펙트로그램으로 변환 후 분석 ### 데이터의 종류 정리 - **출처별**: 내부·외부·기업·공공·원시 데이터 - **구조별**: 정형·반정형·비정형 - **시간 관점**: 시계열·횡단면·패널 - **유형별**: 테이블·그래프·이미지·동영상·음성 - **활용 단계별**: 원천(Raw) → 분석용(Analytical) → 모델 입력(Feature) - **거버넌스 관점**: 마스터·트랜잭션·참조·메타데이터 ### 정형 vs 비정형 비교 - **정형 데이터**: 스키마 정의, RDB·CSV, 분석 용이 - **반정형 데이터**: 스키마 부분 정의, JSON·XML·로그, 파싱 필요 - **비정형 데이터**: 스키마 없음, 텍스트·이미지·동영상, 전체의 80% 차지 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **활용 단계별** — 원천(Raw) → 분석용(Analytical) → 모델 입력(Feature) > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### DIKW 피라미드 URL: https://adsp.todaycode.kr/study/2 태그: DIKW 피라미드, 분석 주제 유형 DIKW 피라미드는 데이터(Data), 정보(Information), 지식(Knowledge), 지혜(Wisdom)의 네 단계로 이루어진 계층 구조입니다. 원시 데이터에서 출발하여 점차 가공과 해석을 거치면서 더 높은 수준의 통찰로 발전하는 과정을 보여줍니다. 이 개념은 ADsP 시험에서 매회 출제되는 최빈출 주제이므로 반드시 이해해야 합니다. 가장 아래에 위치한 데이터(Data)는 가공되기 전의 객관적 사실이자 순수한 수치 또는 기호입니다. "A마트는 100원에, B마트는 300원에 연필을 판매한다"처럼 단순한 사실의 나열이 데이터에 해당합니다. 정보(Information)는 이 데이터를 가공하여 패턴을 인식하고 의미를 도출한 것입니다. "A마트 연필이 B마트보다 싸다"가 정보의 예입니다. 지식(Knowledge)은 상호 연결된 정보 패턴을 이해하여 예측한 결과물입니다. "저렴한 A마트에서 연필을 사야겠다"라는 판단이 지식에 해당합니다. 지혜(Wisdom)는 근본 원리에 대한 깊은 이해를 바탕으로 도출되는 창의적 아이디어입니다. "다른 상품들도 A마트가 B마트보다 저렴할 것이다"라는 일반화된 판단이 지혜입니다. 시험에서는 "이번 8월에 지난 1년 매출액의 50%가 집중되어 있다"와 같은 구체적 문장이 DIKW 중 어디에 해당하는지 묻는 문제가 출제됩니다. 핵심은 '지식'은 "~해야겠다"처럼 의사결정을 내리는 단계이고, '지혜'는 "~할 것이다"처럼 근본 원리를 통해 범위를 확장하여 창의적으로 판단하는 단계라는 점입니다. '정보'는 데이터 간의 비교나 관계를 서술한 것이고, '데이터'는 가공 없는 순수한 사실입니다. --- --- ## 핵심 요약 & 시험 포인트 데이터→정보→지식→지혜로 이어지는 계층 구조입니다. | 단계 | 정의 | 예시 | |------|------|------| | **Data** (데이터) | 가공 전의 객관적 사실, 순수한 수치/기호 | "A마트는 100원, B마트는 300원에 연필 판매" | | **Information** (정보) | 데이터 가공 후 패턴 인식·의미 도출 | "A마트 연필이 B마트보다 싸다" | | **Knowledge** (지식) | 정보 패턴을 이해하고 예측에 활용 | "A마트에서 연필을 사야겠다" | | **Wisdom** (지혜) | 근본 원리에 대한 깊은 이해 기반 창의적 아이디어 | "다른 상품도 A마트가 더 저렴할 것이다" | > 시험 포인트: DIKW 연결 문제는 44~47회 모두 출제된 **최빈출 주제**입니다. 특히 '지식'은 예측, '지혜'는 근본 원리 이해에 기반한 **창의적 판단**이라는 점을 구분하세요. --- ### 지식경영 — 암묵지와 형식지 URL: https://adsp.todaycode.kr/study/3 태그: 지식경영, 데이터베이스 지식경영이란 개인의 암묵지와 집단의 형식지 간에 상호작용(생성, 발전, 전환)을 통해 지식을 발전시키는 기업 경영 방식입니다. 이 개념을 이해하려면 먼저 암묵지와 형식지의 차이를 알아야 합니다. **암묵지(Tacit Knowledge)**는 경험과 학습을 통해 개인에게 습득된 무형의 지식으로, 말이나 글로 표현하기 어려워 다른 사람에게 공유하기 힘듭니다. 자동차 운전 기술, 숙련된 요리사의 감각, 강연 스킬 등이 대표적인 예입니다. **형식지(Explicit Knowledge)**는 매뉴얼, 설계도, 데이터베이스, 프로그램 코드처럼 문서화되어 있어 전달과 공유가 용이한 지식입니다. 암묵지와 형식지는 네 단계의 전환 과정을 통해 상호작용하며 조직의 지식을 발전시킵니다. 이를 SECI 모델이라고 합니다. 첫 번째 단계인 **공통화(Socialization)**는 암묵지에서 암묵지로의 전환으로, 선배가 후배에게 실무 노하우를 직접 보여주며 전달하는 것에 해당합니다. 두 번째 **표출화(Externalization)**는 암묵지를 형식지로 전환하는 것으로, 경험적 노하우를 책이나 매뉴얼로 문서화하는 과정입니다. 세 번째 **연결화(Combination)**는 형식지에서 형식지로의 전환으로, 기존 문서에 새로운 지식을 추가하거나 여러 문서를 결합하는 것입니다. 네 번째 **내면화(Internalization)**는 형식지를 암묵지로 전환하는 것으로, 매뉴얼을 읽고 실습하여 자신만의 체화된 기술로 만드는 과정입니다. 순서는 반드시 "공통화→표출화→연결화→내면화"로 기억해야 하며, 47회 시험에서 이 순서를 묻는 문제가 출제되었습니다. --- --- ## 핵심 요약 & 시험 포인트 지식경영은 개인의 암묵지와 집단의 형식지 간 상호작용(생성·발전·전환)을 통해 지식을 발전시키는 기업 경영 방식입니다. | 구분 | 특징 | 예시 | |------|------|------| | **암묵지** | 경험·학습으로 개인에게 습득된 무형의 지식. 공유 어려움 | 자동차 운전, 강연, 운동 | | **형식지** | 문서화된 지식. 전달·공유 용이 | 작업 매뉴얼, 설계도, DB, 프로그램 | ### 지식 전환 4단계 (SECI 모델) ``` ①공통화 ②표출화 ③연결화 ④내면화 암묵지→암묵지 암묵지→형식지 형식지→형식지 형식지→암묵지 (타인에게 전달) (교재로 문서화) (새 지식 추가) (학습·체화) ``` > **시험 포인트:** 전환 순서는 **공통화→표출화→연결화→내면화** 입니다. 47회에 순서 문제가 출제되었습니다. --- --- ## 추가 핵심 개념 — KMS와 지식 경영 도구 - **KMS(Knowledge Management System, 지식관리시스템)**: 조직 구성원의 암묵지(노하우·경험)를 형식지(매뉴얼·문서)로 표출화·저장·공유하는 시스템. SECI 모델의 실무 구현체로 협업 플랫폼(Confluence·Notion), 위키, 커뮤니티 오브 프랙티스가 대표 도구. - **CoP(Community of Practice)**: 동일한 관심·전문성을 가진 구성원들이 자발적으로 지식을 공유·발전시키는 비공식 학습 공동체. SECI의 사회화·내면화 단계의 무대가 됨. > **시험 핵심**: SECI 4단계(공통화·표출화·연결화·내면화)와 KMS의 역할이 결합되어 출제됩니다. ### SECI 모델 (Nonaka & Takeuchi) - **지식변환(Knowledge Conversion)**: 암묵지와 형식지 사이를 4가지 방식으로 변환하며 지식이 창출·확산 - **공통화(Socialization, 암묵 → 암묵)**: 경험·관찰·도제식 학습으로 암묵지를 공유 - **표출화(Externalization, 암묵 → 형식)**: 암묵지를 언어·문서·모형으로 표현 — 매뉴얼 작성·메타포 사용 - **연결화(Combination, 형식 → 형식)**: 흩어진 형식지를 결합·체계화 — DB·문서 통합 - **내면화(Internalization, 형식 → 암묵)**: 형식지를 실제 경험으로 체득 — 학습·실습 - 4단계가 나선형으로 반복되며 조직 지식이 누적·발전 (Knowledge Spiral) ### SECI 모델 영문 표기 변형 - 한국 교재마다 표기가 다르므로 영문 원어를 알아두는 것이 중요: - **사회화(Socialization)**: 암묵 → 암묵 (Socialization, S) - **외부화(Externalization, 표출화)**: 암묵 → 형식 (E) - **종합화(Combination, 연결화)**: 형식 → 형식 (C) - **내면화(Internalization)**: 형식 → 암묵 (I) - **SECI = Socialization + Externalization + Combination + Internalization** - 한국 교재의 변형 표기: 공통화/사회화·표출화/외부화·연결화/종합화·내면화/체화 ### 데이터베이스의 정의와 특징 URL: https://adsp.todaycode.kr/study/4 태그: 데이터베이스, 분석 주제 유형, OLAP, IoT·플랫폼, 데이터 품질, MLOps·최신 ML 데이터베이스는 여러 사람이 공유하여 사용할 목적으로 통합하여 관리하는 데이터의 집합을 말합니다. 일상생활에서 도서관의 책 목록, 온라인 쇼핑몰의 상품 목록 등이 모두 데이터베이스라고 할 수 있습니다. 시험에서는 데이터베이스의 네 가지 특징과 다양한 활용 측면이 출제됩니다. 데이터베이스의 네 가지 특징은 다음과 같습니다. 통합 데이터(Integrated Data)는 동일한 내용이 중복되어 저장되지 않도록 관리된 데이터입니다. 예를 들어 같은 고객 정보가 두 곳에 따로 저장되지 않습니다. 공유 데이터(Shared Data)는 여러 사용자가 동시에 접근하여 활용할 수 있는 데이터입니다. 여기서 주의할 점은 "모든 사용자가 동일한 목적으로 활용한다"는 설명은 틀렸다는 것입니다. 같은 데이터라도 마케팅 부서와 재무 부서가 서로 다른 목적으로 활용할 수 있습니다. 운영 데이터(Operational Data)는 조직의 고유한 기능을 수행하기 위해 반드시 필요한 데이터입니다. 저장 데이터(Stored Data)는 컴퓨터가 접근할 수 있는 저장 매체에 저장된 데이터를 의미합니다. 데이터베이스는 활용 측면에서도 여러 관점으로 나뉩니다. 정보 축적 및 전달 측면에서는 기계 가독성(정보처리 기기가 대량 정보를 읽고 쓸 수 있음), 검색 가능성(필요한 정보를 쉽게 찾음), 원격 조작성(온라인에서 원거리 활용 가능)이라는 세 가지 특성을 가집니다. 이 세 가지 특성을 묻는 문제가 46회와 47회에 출제되었습니다. 정보 이용 측면은 사용자가 원하는 정보를 신속하게 획득하는 것이고, 정보 관리 측면은 관리 소프트웨어와 하드웨어에 관한 것이며, 정보 기술 발전 측면은 네트워크 기술 발전을 견인하는 역할에 해당합니다. --- --- ## 핵심 요약 & 시험 포인트 데이터베이스는 여러 사람이 공유하여 사용할 목적으로 통합하여 관리하는 데이터의 집합입니다. ### 데이터베이스의 4가지 특징 | 특징 | 설명 | |------|------| | **통합 데이터(Integrated Data)** | 중복 최소화, 통제된 데이터 | | **공유 데이터(Shared Data)** | 여러 사용자가 서로 다른 목적으로 동시에 사용 | | **운영 데이터(Operational Data)** | 조직 고유 기능 수행에 반드시 필요한 데이터 | | **저장 데이터(Stored Data)** | 컴퓨터가 접근 가능한 저장 매체에 보관 | ### 정보 축적 및 전달 측면 3대 특성 **기계 가독성**, **검색 가능성**, **원격 조작성** > 시험 포인트: 공유 데이터는 여러 사용자가 **서로 다른 목적으로** 활용할 수 있습니다. 동일 목적이 아닙니다. --- --- ## 데이터베이스 활용 분야 - 주요 시스템 4가지 | 시스템 | 풀네임 | 목적 | 데이터 | |--------|-------|------|--------| | **CRM** | Customer Relationship Management | **고객** 관계 관리 | 고객, 구매, 접점 | | **SCM** | Supply Chain Management | **공급망** 최적화 | 재고, 물류, 협력사 | | **ERP** | Enterprise Resource Planning | **전사 자원** 통합 | 회계, HR, 생산 | | **BI** | Business Intelligence | **의사결정 지원** | OLAP, 대시보드, 리포트 | ### 분야별 데이터베이스 활용 - **금융**: 신용평가, 사기 탐지, 리스크 관리 - **제조**: 품질 관리, 예측 정비, 공정 최적화 - **유통**: 재고 관리, 추천, 가격 최적화 - **공공**: 행정 통계, 정책 결정, 민원 분석 - **의료**: 전자의무기록(EMR), 임상의사결정지원(CDSS), 신약 개발 > **시험 포인트**: CRM은 "고객", SCM은 "공급망", ERP는 "전사 자원". BI는 분석·의사결정. 분야별 활용 사례 매칭 문제 자주 출제. ### 데이터 무결성(Integrity) 종류 - **개체 무결성(Entity Integrity)**: 기본키는 NULL이 될 수 없고 유일해야 함 — 모든 행을 고유하게 식별 - **참조 무결성(Referential Integrity)**: 외래키 값은 참조 테이블의 기본키에 실제로 존재하거나 NULL이어야 함 — 부모-자식 관계 일관성 보장 - **도메인 무결성**: 컬럼 값이 정의된 도메인(타입·범위·형식)을 따라야 함 - **사용자 정의 무결성**: 업무 규칙에 따른 제약 조건(예: 나이 ≥ 0) ### 인덱스(Index)와 자료구조 - **인덱스(Index)**: 테이블 검색 속도를 높이는 보조 자료구조. 책의 색인과 같은 역할 - **B-tree 인덱스**: 균형 잡힌 다진 트리 — 범위 검색에 효율적, 대부분 RDBMS의 기본 인덱스 - **B+tree**: 리프 노드만 데이터 포인터, 리프 노드끼리 연결 리스트 — 범위 스캔 최적 - **해시 인덱스**: 동등 검색에 빠르나 범위 검색 불가 - **인덱스의 트레이드오프**: 조회 성능↑, 쓰기 성능↓·저장 공간↑ ### 키(Key) 종류 - **Primary Key(기본키)**: 행을 유일하게 식별하는 키 — NULL 불가·유일성 보장 - **Foreign Key(외래키)**: 다른 테이블의 기본키를 참조하는 키 — 참조 무결성의 핵심 - **Candidate Key(후보키)**: 기본키가 될 수 있는 키들의 집합 - **Super Key(슈퍼키)**: 유일성만 만족하면 됨 (최소성 불필요) - **Alternate Key(대체키)**: 후보키 중 기본키가 아닌 키 ### 트랜잭션과 동시성 - **트랜잭션(Transaction)**: 논리적 작업 단위 — 더 이상 나눌 수 없는 일련의 연산 - **트랜잭션의 ACID**: 원자성·일관성·고립성·지속성 - **Concurrency Control(동시성 제어)**: 여러 사용자가 동시에 DB를 접근할 때 데이터 일관성 보장 - **Locking(락)**: 자원을 잠가 동시 접근 제어 — 공유락·배타락 - **Deadlock(데드락)**: 두 트랜잭션이 서로의 자원을 기다리며 무한 대기 → 탐지·예방 필요 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **인덱스** — 테이블 검색 속도를 높이는 보조 자료구조. 책의 색인과 같은 역할 - **B-tree 인덱스** — 균형 잡힌 다진 트리 — 범위 검색에 효율적, 대부분 RDBMS의 기본 인덱스 - **B+tree** — 리프 노드만 데이터 포인터, 리프 노드끼리 연결 리스트 — 범위 스캔 최적 - **인덱스의 트레이드오프** — 조회 성능↑, 쓰기 성능↓·저장 공간↑ > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### DBMS와 데이터베이스 유형 URL: https://adsp.todaycode.kr/study/5 태그: 데이터 유형, 데이터베이스, DBMS, 데이터 전처리, OLAP, SQL, MLOps·최신 ML **DBMS(Database Management System)**는 사용자의 요구에 따라 정보를 처리하고 데이터베이스를 관리해주는 소프트웨어입니다. 쉽게 말해, 데이터베이스라는 거대한 창고를 체계적으로 관리해주는 관리자 프로그램이라고 생각하면 됩니다. DBMS의 장점으로는 데이터의 중복을 최소화하고, 일관성과 무결성을 유지하며, 여러 사용자가 동시에 접근할 수 있고, SQL이라는 표준화된 언어로 제어가 쉽고, 접근 권한을 제어하여 민감한 정보를 보호할 수 있다는 점이 있습니다. 여기서 **무결성(Integrity)**이란 데이터의 정확성과 일관성이 유지되는 것을 말합니다. 단점으로는 모든 데이터 문제를 해결할 수 없고, 유지보수 비용이 발생하며, 전문적인 관리 지식이 필요하고, 시스템에 문제가 생기면 저장된 모든 데이터에 영향을 줄 수 있으며, 새로운 버전을 적용할 때 호환성 문제가 발생할 수 있다는 점이 있습니다. DBMS는 크게 세 가지 유형으로 나뉩니다. **RDBMS(관계형 데이터베이스 관리 시스템)**는 데이터를 행과 열로 구성된 테이블 형태로 관리하며, MySQL, Oracle, PostgreSQL, MS SQL Server 등이 대표적입니다. 가장 널리 사용되는 유형입니다. RDBMS는 **ACID** 특성을 보장합니다: **원자성(Atomicity)** 트랜잭션은 전부 성공하거나 전부 취소, **일관성(Consistency)** 데이터 정합성 유지, **고립성(Isolation)** 다른 트랜잭션의 영향 차단, **지속성(Durability)** 완료된 트랜잭션은 영구 보존. **ODBMS(객체 지향 데이터베이스 관리 시스템)**는 복잡한 데이터 구조를 객체 단위로 표현하고 관리하며, 상위 계층의 속성과 방법을 하위 계층이 물려받는 상속 개념을 지원합니다. **NoSQL(Non-SQL)**은 관계형 DB보다 덜 제한적인 일관성 모델을 사용하며, 디자인이 단순하고 수평적 확장이 쉬운 것이 특징입니다. MongoDB, Redis, Apache Cassandra, HBase 등이 대표적입니다. 대용량 비정형 데이터를 다룰 때 주로 사용됩니다. NoSQL은 RDBMS의 ACID 대신 **BASE** 특성을 가집니다: **기본 가용성(Basically Available)** 항상 응답은 보장, **소프트 상태(Soft State)** 시간에 따라 데이터 상태가 변할 수 있음, **최종 일관성(Eventually Consistent)** 일시적 불일치 허용 후 최종적으로 일관성 달성. ### RDBMS vs NoSQL 일관성 모델 비교 | 속성 | RDBMS (ACID) | NoSQL (BASE) | |------|-------------|-------------| | **가용성** | 엄격한 일관성 우선 | 높은 가용성 우선 | | **일관성** | 즉시 일관성 보장 | 최종적 일관성(Eventually Consistent) | | **확장성** | 수직 확장(Scale-Up) | 수평 확장(Scale-Out) | > **시험 포인트:** RDBMS = **ACID**, NoSQL = **BASE** 특성을 가집니다. --- --- ## OLAP 5대 연산 **OLAP(Online Analytical Processing)**은 다차원 데이터를 분석하기 위한 연산입니다. | 연산 | 설명 | 예시 | |------|------|------| | **Drill-down** | 상위 차원 → 하위 차원 (상세화) | 연도 → 월 → 일 | | **Roll-up** | 하위 차원 → 상위 차원 (요약·집계) | 일 → 월 → 연도 | | **Slice** | **하나의 차원**을 한 값으로 고정 | 2025년 매출만 보기 | | **Dice** | **여러 차원**을 부분집합으로 자름 | 2025년 + 서울 + 모바일 | | **Pivot(Rotate)** | 차원의 축을 회전 | 행/열 교환 | ### OLAP vs OLTP | 구분 | OLAP | OLTP | |------|------|------| | 목적 | 분석·의사결정 | 운영·트랜잭션 | | 데이터 | 집계, 이력 | 현재, 실시간 | | 쿼리 | 복잡, 읽기 중심 | 단순, 읽기/쓰기 | | 사용자 | 분석가, 경영진 | 일반 사용자 | > **시험 포인트**: Drill-down ↔ Roll-up이 짝. Slice는 1차원, Dice는 다차원 부분집합. Pivot은 축 회전. ### 관계형 DB 정규화 - **1NF(제1정규형)**: 모든 속성이 원자값(분해 불가) - **2NF(제2정규형)**: 1NF + 부분 함수 종속 제거 (기본키 일부에만 종속되는 속성 분리) - **3NF(제3정규형)**: 2NF + 이행적 함수 종속 제거 (A→B→C에서 C가 A에 직접 종속되게 분리) - **BCNF(Boyce-Codd Normal Form)**: 3NF의 강화형 — 모든 결정자가 후보키 - **역정규화(Denormalization)**: 성능을 위해 의도적으로 정규화를 풀어 중복 허용 ### 분산 DB 이론 - **ACID**: 원자성·일관성·고립성·지속성 — 전통 RDBMS의 트랜잭션 보장 - **BASE**: 기본 가용성·소프트 상태·결과적 일관성 — NoSQL의 완화된 보장 - **CAP 정리**: 일관성·가용성·분할내성 중 동시에 만족 가능한 것은 2가지뿐 - **샤딩(Sharding)**: 데이터를 키 기준으로 여러 노드에 분할 — 수평 확장 - **복제(Replication)**: 동일 데이터를 여러 노드에 복사 — 가용성·읽기 성능 향상 ### OLAP(Online Analytical Processing) 연산 - **드릴다운(Drill-down)**: 요약 → 상세 단계로 깊게 파고들기 (연도 → 월 → 일) - **롤업(Roll-up)**: 상세 → 요약 단계로 집계 (일별 → 월별) - **슬라이싱(Slicing)**: 다차원 큐브의 한 면을 잘라 2차원으로 보기 (특정 연도만) - **다이싱(Dicing)**: 여러 차원으로 잘라 부분 큐브 보기 (특정 연도+지역) - **피봇팅(Pivoting)**: 차원의 축을 회전·변경해 다른 관점으로 보기 ### OLAP 종류 - **MOLAP(Multidimensional OLAP)**: 다차원 큐브 저장 — 빠른 조회, 큰 저장공간 - **ROLAP(Relational OLAP)**: 관계형 DB 기반 — 큰 데이터에 적합, 다소 느림 - **HOLAP(Hybrid OLAP)**: 두 방식 혼합 ### 데이터 모델링 (DW) - **별 스키마(Star Schema)**: 중앙 팩트 테이블 + 주변 차원 테이블 — 단순·빠름 - **눈송이 스키마(Snowflake Schema)**: 차원 테이블을 정규화 — 저장공간 절약, 조인 복잡 - **팩트 테이블**: 측정값(매출·수량) 보관 - **차원 테이블**: 분석 관점(시간·지역·제품) 보관 ### SQL 명령어 4분류 - **DDL(Data Definition Language)**: 데이터 정의 — CREATE·ALTER·DROP·TRUNCATE - **DML(Data Manipulation Language)**: 데이터 조작 — SELECT·INSERT·UPDATE·DELETE - **DCL(Data Control Language)**: 권한 제어 — GRANT·REVOKE - **TCL(Transaction Control Language)**: 트랜잭션 제어 — COMMIT·ROLLBACK·SAVEPOINT ### SELECT 구문 핵심 절 - **SELECT 컬럼 FROM 테이블 WHERE 조건 GROUP BY 컬럼 HAVING 그룹조건 ORDER BY 컬럼** - **WHERE**: 행 단위 필터 (그룹화 이전) - **GROUP BY**: 그룹화 - **HAVING**: 그룹 단위 필터 (그룹화 이후) - **ORDER BY**: 정렬 (ASC 오름차순, DESC 내림차순) - **JOIN 종류**: INNER JOIN (교집합), LEFT/RIGHT OUTER JOIN, FULL OUTER JOIN, CROSS JOIN ### 다차원 분석 - **다차원 분석(Multidimensional Analysis)**: 큐브 형태의 데이터를 여러 차원(시간·지역·제품)으로 보는 분석 — OLAP의 본질 - **데이터 큐브(Data Cube)**: 다차원 분석을 위한 데이터 구조 ### SQL 집계 함수 - **COUNT(*)**: 행의 개수 — NULL 포함 - **COUNT(컬럼)**: 해당 컬럼의 NULL 제외 개수 - **SUM, AVG, MIN, MAX**: 합·평균·최소·최대 — NULL 자동 제외 - **DISTINCT**: 중복 제거 후 카운트·집계 - GROUP BY와 함께 사용 시 그룹별 집계 ### 트랜잭션 격리 수준 (Isolation Levels) 1. **READ UNCOMMITTED**: Dirty Read 발생 가능 — 가장 약함 2. **READ COMMITTED**: 커밋된 데이터만 읽기 — Dirty Read 방지, Non-repeatable Read 발생 3. **REPEATABLE READ**: 트랜잭션 내 동일 행 동일 결과 — Phantom Read 발생 4. **SERIALIZABLE**: 직렬화 — 가장 엄격, 성능 저하 - 트레이드오프: 격리 수준 ↑ ⇄ 성능 ↓ ### 트랜잭션 ACID 추가 - **All or Nothing(원자성)**: 트랜잭션은 전체 성공 또는 전체 실패 — 부분 실행 불가 ### 확률적 자료구조 (대용량 처리) - **Bloom Filter(블룸 필터)**: 멤버십 검사를 위한 공간 효율적 자료구조 - 거짓 양성(False Positive)은 가능, 거짓 음성은 없음 - 활용: 캐시 미스 사전 차단·중복 URL 필터·DB 키 존재 검사 - **HyperLogLog**: 카디널리티(고유 개수) 근사 추정 - 메모리 1.5KB로 수십억 카디널리티 추정 — 1~2% 오차 - **Count-Min Sketch**: 빈도 추정 — 스트리밍 빈도 분석 - 공통 특성: 100% 정확도 포기 + 메모리 효율 극대화 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **2NF** — 1NF + 부분 함수 종속 제거 (기본키 일부에만 종속되는 속성 분리) - **3NF** — 2NF + 이행적 함수 종속 제거 (A→B→C에서 C가 A에 직접 종속되게 분리) - **BCNF** — 3NF의 강화형 — 모든 결정자가 후보키 - **역정규화** — 성능을 위해 의도적으로 정규화를 풀어 중복 허용 - **BASE** — 기본 가용성·소프트 상태·결과적 일관성 — NoSQL의 완화된 보장 - **CAP 정리** — 일관성·가용성·분할내성 중 동시에 만족 가능한 것은 2가지뿐 - **드릴다운** — 요약 → 상세 단계로 깊게 파고들기 (연도 → 월 → 일) - **슬라이싱** — 다차원 큐브의 한 면을 잘라 2차원으로 보기 (특정 연도만) - **ROLAP** — 관계형 DB 기반 — 큰 데이터에 적합, 다소 느림 - **All or Nothing** — 트랜잭션은 전체 성공 또는 전체 실패 — 부분 실행 불가 - **Bloom Filter** — 멤버십 검사를 위한 공간 효율적 자료구조 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 기억 용량 단위와 자료 구성 단위 URL: https://adsp.todaycode.kr/study/6 태그: 데이터베이스, 기억 용량 단위 컴퓨터가 데이터를 저장할 때 사용하는 용량 단위는 계층적 구조를 가집니다. 가장 작은 단위부터 순서대로 **KB(킬로바이트), MB(메가바이트), GB(기가바이트), TB(테라바이트), PB(페타바이트), EB(엑사바이트), ZB(제타바이트), YB(요타바이트)**입니다. 각 단계 사이는 정확히 1024배(2의 10승) 관계입니다. 예를 들어 1ZB는 1024EB이고, 1PB는 1024TB입니다. 시험에서는 "1제타바이트는 1024 엑사바이트이다"와 같은 문제가 출제됩니다. 단위 간의 순서를 정확히 외우는 것이 중요하며, **"킬(K) 메(M) 기(G) 테(T) 페(P) 엑(E) 제(Z) 요(Y)"**로 첫 글자를 연결하여 암기하면 편리합니다. 수학적으로는 KB=2의 10승, MB=2의 20승 등으로 10씩 증가하는 지수로도 표현됩니다. 자료 구성 단위도 계층적 구조를 가집니다. 가장 작은 단위인 **비트(Bit)**는 0 또는 1의 이진수 하나를 저장하는 데이터의 최소 단위입니다. 4개의 비트가 모이면 니블(Nibble), 8개의 비트가 모이면 **1바이트(Byte)**가 됩니다. 1바이트는 영문자 한 글자, 숫자 하나, 공백, 또는 특수문자 하나를 표현할 수 있습니다. 한글이나 한자 같은 문자의 바이트 수는 인코딩 방식에 따라 다릅니다. **EUC-KR** 인코딩에서 한글 1자는 **2바이트**, **UTF-8** 인코딩에서 한글 1자는 **3바이트**를 차지합니다. 바이트 위로는 **워드(Word)**, 컴퓨터가 한 번에 처리하는 명령 단위 필드(Field), 레코드(Record), 파일(File), 데이터베이스(DB) 순서로 점점 큰 단위가 됩니다. --- ### 기억 용량 단위 (1024배수) - **비트(Bit)** < **바이트(Byte, 8비트)** < **KB(킬로바이트)** < **MB(메가)** < **GB(기가)** < **TB(테라)** < **PB(페타)** < **EB(엑사)** < **ZB(제타)** < **YB(요타)** - 빅데이터는 보통 TB~PB 수준에서 다뤄짐 - 전 세계 데이터 양은 ZB 단위로 측정 (IDC 통계 기준) ### 자료 구성 단위 (작은 단위부터) - **비트(Bit)**: 0 또는 1, 정보의 최소 단위 - **니블(Nibble)**: 4비트 — 16진수 한 자릿수 - **바이트(Byte)**: 8비트 — 문자 1자 - **워드(Word)**: CPU가 한 번에 처리하는 비트 수 (16/32/64bit) - **필드(Field)**: 의미 있는 자료 항목 — 컬럼 1개 - **레코드(Record)**: 관련 필드의 집합 — 행 1개 - **테이블(Table)**: 같은 형식 레코드의 집합 - **파일(File)**: 관련 테이블·데이터의 집합 - **데이터베이스(Database)**: 통합 관리되는 파일들의 집합 ### 이진(IEC) vs 십진(SI) 단위 구분 - **이진 단위(Binary Unit, IEC 표준)**: 1024배수 — KiB(키비바이트, 2¹⁰)·MiB·GiB·TiB·PiB - 1 KiB = 1024 B - 1 MiB = 1024 KiB = 1,048,576 B - 메모리·OS 표시에서 사용 - **십진 단위(SI 단위)**: 1000배수 — KB·MB·GB·TB·PB - 1 KB = 1000 B - 디스크 제조사 광고·네트워크 속도에 사용 - 디스크 크기 vs OS 표시 차이의 원인 — 같은 1TB 디스크가 OS에서 ~931 GiB로 보임 - ADsP 시험에서는 KB·MB·GB로 보통 출제 (정확한 이진/십진 구분은 부차적) ### 데이터 구성 단위 추가 - **데이터 가치 사슬(Data Value Chain)**: 데이터에서 가치로의 흐름 - 생성 → 수집 → 저장 → 처리 → 분석 → 시각화 → 의사결정 → 가치 실현 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **이진 단위** — 1024배수 — KiB(키비바이트, 2¹⁰)·MiB·GiB·TiB·PiB - **십진 단위** — 1000배수 — KB·MB·GB·TB·PB > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 시대별·분야별 데이터베이스 솔루션 URL: https://adsp.todaycode.kr/study/7 태그: 데이터베이스, 분석 주제 유형, OLAP, 데이터 웨어하우스, IoT·플랫폼 기업에서 데이터를 활용하는 방식은 시대에 따라 발전해왔습니다. 이 흐름을 이해하면 각 솔루션의 역할을 쉽게 구분할 수 있습니다. 1980년대에 등장한 **OLTP(Online Transaction Processing)**는 은행 거래, 온라인 쇼핑, 예약 시스템처럼 실시간으로 발생하는 트랜잭션을 처리하는 시스템입니다. 트랜잭션이란 데이터의 삽입, 수정, 삭제 같은 짧고 빈번한 작업을 의미합니다. 같은 시기에 등장한 **OLAP(Online Analytical Processing)**는 이미 축적된 대량의 데이터를 다차원적으로 분석하여 통계 요약 정보를 제공하는 시스템입니다. OLTP는 "기록하는 시스템", OLAP는 "분석하는 시스템"이라고 이해하면 됩니다. 시험에서 이 둘의 구분은 매회 출제되며, "OLTP가 데이터 조회 및 분석에 사용된다"는 설명은 OLAP의 역할을 설명한 것이므로 틀립니다. 2000년대에는 **CRM(Customer Relationship Management)**과 **SCM(Supply Chain Management)**이 등장했습니다. CRM은 고객 데이터를 분석하여 고객을 깊이 이해하고, 이를 바탕으로 마케팅 전략을 수립하여 높은 이익을 창출하는 시스템입니다. SCM은 원재료 조달부터 제품이 소비자에게 전달되기까지의 전체 유통 과정을 정보기술로 관리하여 재고와 비용을 최적화하는 시스템입니다. 1990년대에 본격 보급된 **ERP(Enterprise Resource Planning)**는 회계, 인사, 생산, 물류 등 기업의 핵심 업무를 하나의 통합 시스템으로 관리하며, **BI(Business Intelligence)**는 데이터 웨어하우스에 축적된 데이터를 분석하여 경영 의사결정에 필요한 정보를 제공합니다. --- --- ## 핵심 요약 & 시험 포인트 ### 시대별 | 시대 | 솔루션 | 핵심 | |------|--------|------| | **1980년대** | OLTP | 실시간 **트랜잭션 처리** (삽입/수정/삭제) | | **1980년대** | OLAP | 다차원 데이터의 **대화식 분석** 및 통계 요약 | | **1990년대** | ERP | 회계·인사·생산·물류 등 기업의 **핵심 업무 통합 관리** | | **1990년대** | DW (데이터 웨어하우스) | 의사결정 지원을 위해 **주제 중심으로 통합·축적**된 데이터 저장소 | | **2000년대** | CRM | 고객 이해 기반 **마케팅 전략** → 이익 창출 | | **2000년대** | SCM | 정보기술 활용 **유통·재고 최적화** | > **시험 포인트:** OLTP vs OLAP 구분은 매 회차 출제됩니다. OLTP는 **거래 처리**(짧고 빈번한 트랜잭션), OLAP는 **분석 처리**(다차원 데이터 분석)입니다. ### 분야별 | 솔루션 | 핵심 | |--------|------| | **ERP** | 여러 모듈로 구성된 **통합 애플리케이션** → 프로세스 관리 | | **RTE** | 비즈니스 프로세스 투명·민첩 유지, **지연시간 제거** | | **BI** | 데이터 웨어하우스에서 **경영 의사결정**에 필요한 정보 획득 | --- ### 빅데이터의 정의와 특성 URL: https://adsp.todaycode.kr/study/8 태그: 데이터베이스, 기억 용량 단위, 빅데이터, 빅데이터 3V/5V, 분석 주제 유형, 우선순위 평가, 모형 평가, 데이터 전처리, 데이터 기반 의사결정, 표본조사 빅데이터란 기존의 데이터베이스 관리 도구로는 처리하기 어려운 대용량 데이터를 활용하여 새로운 통찰과 가치를 만들어내는 것을 말합니다. 단순히 데이터의 양이 많다는 것을 넘어서, 다양한 형태의 데이터를 빠르게 처리하여 비즈니스에 활용한다는 의미를 포함합니다. 빅데이터의 특성은 흔히 "V"로 시작하는 키워드로 표현됩니다. 3V는 Volume(양), Variety(다양성), Velocity(속도)를 의미합니다. Volume은 테라바이트를 넘어서는 초대규모의 데이터 양을, Variety는 텍스트, 이미지, 영상, 음성 등 정형·반정형·비정형을 아우르는 데이터의 다양성을, Velocity는 데이터가 실시간으로 생성되고 빠르게 처리되어야 하는 속도를 의미합니다. 여기에 Value(가치)를 더한 4V도 자주 언급되며, Value는 투자 대비 수익률(ROI) 관점에서 비즈니스 효과를 강조합니다. 시험에서 "Availability(가용성)"가 빅데이터의 V에 해당한다는 보기가 나오면 틀린 것입니다. 빅데이터 시대는 데이터 분석의 방향도 크게 바꾸었습니다. 기존에는 데이터를 미리 정제하고 분석하는 사전처리 방식이었지만 이제는 사후처리 방식으로 전환되고 있습니다. 일부만 뽑아서 분석하는 표본조사에서 모든 데이터를 분석하는 전수조사로 변화하고 있습니다. 또한 소수의 정확한 데이터(질)보다 대량의 데이터(양)를 중시하며, 왜 그런지를 밝히는 인과관계보다 무엇과 관련이 있는지를 파악하는 상관관계를 더 중요시합니다. 이 네 가지 변화 방향은 시험에 빈출되므로 반드시 외워야 합니다. --- --- ## 핵심 요약 & 시험 포인트 빅데이터의 특성은 3V(Volume, Variety, Velocity)에서 4V(+Value), 5V(+Veracity)로 확장됩니다. | 특성 | 의미 | |------|------| | **Volume(양)** | 테라바이트를 넘는 초대규모 데이터 | | **Velocity(속도)** | 실시간 생성 및 처리 | | **Variety(다양성)** | 정형·반정형·비정형 아우르는 다양한 형태 | | **Value(가치)** | 투자 대비 비즈니스 효과(ROI) | | **Veracity(정확성)** | 데이터의 신뢰성·정확도 | ### 빅데이터 시대의 4가지 패러다임 변화 | 기존 방식 | 빅데이터 방식 | |-----------|--------------| | 사전처리 | **사후처리** | | 표본조사 | **전수조사** | | 질(소수 정확) | **양(대량 데이터)** | | 인과관계 | **상관관계** | > 시험 포인트: 빅데이터의 V는 Volume, Velocity, Variety, Value, Veracity입니다. Availability(가용성)는 포함되지 않습니다. --- --- ## 빅데이터 V 모델의 변천 | 모델 | V 항목 | 출처 | |------|--------|------| | **3V** | Volume(규모), Velocity(속도), Variety(다양성) | Gartner 2001 (Doug Laney) | | **4V** | + Veracity (정확성·신뢰성) | IBM | | **5V** | + Value (가치) | 일반적 정의 | | **7V** | + Variability(가변성) + Visualization(시각화) | 확장 모델 | ### 각 V 의미 - **Volume**: TB → PB → ZB 규모 - **Velocity**: 실시간/스트리밍 처리 속도 - **Variety**: 정형(RDB) + 반정형(JSON, XML) + 비정형(텍스트, 이미지, 영상) - **Veracity**: 데이터의 신뢰성·품질 (노이즈, 결측, 편향) - **Value**: 분석을 통한 비즈니스 가치 창출 - **Variability**: 데이터 의미의 시간적·맥락적 가변성 - **Visualization**: 분석 결과의 시각적 전달 > **시험 포인트**: 3V(Gartner)가 시작. Veracity(정확성), Value(가치)가 핵심 추가 V. ### 빅데이터의 4V → 5V → 7V - **4V**: Volume(규모) · Velocity(속도) · Variety(다양성) · **Veracity(정확성)** — IBM이 추가 - **5V**: 4V + **Value(가치)** — 데이터 자체보다 추출되는 가치 강조 - **7V**: 5V + Validity(유효성) + Volatility(휘발성) ### 데이터 폭증 배경 - **데이터 폭증(Data Explosion)**: 소셜미디어·IoT·로그 등으로 생성 데이터가 기하급수적 증가 - **2.5 quintillion bytes/day** 수준의 글로벌 데이터 생성 (~2018 기준) ### 빅데이터 정의자 - **Doug Laney(더그 래니)**: META Group(현 Gartner) 분석가, 2001년 빅데이터의 **3V(Volume·Velocity·Variety)** 정의 처음 제시 - IBM 등이 **Veracity(정확성)**을 추가하며 4V로 확장 - 이후 **Value(가치)**·**Validity(유효성)**·**Volatility(휘발성)** 추가로 5V·7V 확장 ### 데이터 폭증의 원인 - SNS·IoT·센서·로그·자율주행·이미지/영상 등 디지털 흔적 증가 - **2025년 글로벌 데이터 생성량**: 175 ZB 추산 (IDC) ### 데이터 거래 - **데이터 가치 사슬(Data Value Chain)**: 데이터에서 가치를 추출·전달하는 일련의 활동 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **데이터 폭증** — 소셜미디어·IoT·로그 등으로 생성 데이터가 기하급수적 증가 - **2.5 quintillion bytes/day** — 수준의 글로벌 데이터 생성 (~2018 기준) - **Doug Laney** — META Group(현 Gartner) 분석가, 2001년 빅데이터의 **3V(Volume·Velocity·Variety)**… - **데이터 가치 사슬** — 데이터에서 가치를 추출·전달하는 일련의 활동 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 빅데이터의 출현 배경과 가치 URL: https://adsp.todaycode.kr/study/9 태그: 데이터 유형, 빅데이터, 빅데이터 가치, 분석 주제 유형, 기술통계, IoT·플랫폼, 하둡·빅데이터 인프라 빅데이터가 등장한 배경에는 여러 요인이 있습니다. 소셜미디어(SNS)와 영상 콘텐츠의 폭발적 성장으로 비정형 데이터가 크게 늘어났고, 하드디스크 등 저장 장치의 가격이 크게 하락했습니다. 클라우드 컴퓨팅이 등장하여 분산 병렬 처리로 대규모 데이터를 저비용으로 처리할 수 있게 되었습니다. 인터넷의 보급과 디지털화가 가속되었고, **IoT(사물인터넷)** 기기의 확산으로 센서 데이터가 대량 생성되기 시작했습니다. 또한 양질전환 법칙이라 하여, 데이터의 양적 누적이 일정 수준을 넘으면 질적으로 완전히 다른 가치를 만들어내는 현상이 나타났습니다. 빅데이터의 가치는 비유적 표현으로도 자주 설명됩니다. 철과 석탄은 1차에서 2차 산업혁명으로의 전환을 이끈 핵심 재료였듯이, 빅데이터가 디지털 혁명의 원료라는 의미입니다. **원유(디지털 경제의 에너지원)**는 현대 경제의 주요 에너지원이라는 비유로, 빅데이터가 디지털 경제를 움직이는 에너지라는 뜻입니다. 렌즈는 현미경 렌즈가 보이지 않는 세계를 보여주었듯이, 빅데이터가 숨겨진 패턴을 발견하게 해준다는 비유입니다. 플랫폼은 다양한 주체가 공동으로 활용할 수 있는 구조물이라는 의미입니다. 빅데이터의 가치를 정확히 산정하기 어려운 이유도 있습니다. 데이터의 활용 방식이 다양해지면서 특정 데이터가 누구에 의해, 언제, 어디서 사용될지 예측하기 어렵습니다. 또한 현재는 쓸모없어 보이는 데이터라도 새로운 분석 기술이 등장하면 가치 있는 데이터로 탈바꿈할 수 있기 때문입니다. --- --- ## 핵심 요약 & 시험 포인트 ### 출현 배경 - SNS·영상 등 **비정형 데이터 확산**, 저장·처리 장치 가격 하락 - **클라우드 컴퓨팅** (분산 병렬 처리로 비용 감소) - 인터넷 보급, 디지털화, IoT 확산 - 인간 게놈 프로젝트 / **양질전환 법칙** (양적 누적이 질적 비약으로 전환) ### 빅데이터에 거는 기대 (비유적 표현) | 비유 | 의미 | |------|------| | 철/석탄 | 산업혁명의 핵심 재료 | | 원유 | 주요 에너지원 | | 렌즈 | 현미경 렌즈처럼 보이지 않는 것을 보게 함 | | 플랫폼 | 공동 활용 목적의 유·무형 구조물 | ### 가치 산정이 어려운 이유 - 데이터 활용 시점/장소/대상이 불분명 (다양한 활용 방식) - 과거에 무가치했던 데이터가 새로운 분석 기술로 가치 창출 가능 --- --- ## 데이터 가치 측정의 어려움 4가지 빅데이터 시대에 데이터의 경제적 가치를 평가하기 어려운 이유: | 어려움 | 설명 | |--------|------| | **데이터 활용 방식의 다양성** | 동일 데이터가 재사용·재조합·**Mash-up**으로 새 가치 창출 | | **새로운 가치 창출** | 현재의 가치 ≠ 미래의 가치. 분석 기법 발전으로 잠재 가치 변동 | | **분석 기술의 발전** | 오늘 분석할 수 없는 데이터가 내일은 가능 (예: 비정형 텍스트, 영상) | | **데이터 수집·저장 비용 감소** | 기술 발전으로 비용↓, 가치 평가 기준이 시대마다 변동 | > **시험 포인트**: "데이터의 가치 측정이 쉽다"는 보기는 틀림. 재사용·재조합·새로운 활용 등으로 가치가 변동되어 측정이 어려움. --- ## 추가 핵심 개념 — 빅데이터 인프라와 처리 아키텍처 - **MapReduce**: 대용량 데이터를 Map(키-값 변환) → Shuffle(키별 그룹화) → Reduce(집계)의 분산 처리 모델. Google 논문·Hadoop의 핵심. - **HDFS(Hadoop Distributed File System)**: 대용량 파일을 블록 단위로 여러 노드에 분산·복제 저장하는 파일 시스템. NameNode(메타) + DataNode(데이터) 구조. - **Hive**: HDFS 위에 SQL과 유사한 HiveQL로 질의할 수 있는 데이터 웨어하우스 인프라(내부적으로 MapReduce/Spark 변환). - **NoSQL**: ACID 대신 BASE(Basically Available·Soft state·Eventually consistent) 특성. 4유형: Key-Value(Redis), Document(MongoDB), Column-family(Cassandra), Graph(Neo4j). - **CAP 정리**: 분산 시스템은 일관성(Consistency)·가용성(Availability)·분할내성(Partition tolerance) 중 2개만 동시 보장 가능. - **람다(Lambda) 아키텍처**: 배치 레이어(정확성) + 스피드 레이어(실시간) + 서빙 레이어(통합 제공)의 3계층 빅데이터 처리. - **카파(Kappa) 아키텍처**: 람다의 코드 중복을 해결한 단일 스트리밍 레이어 구조(Kafka·Flink). - **엣지 컴퓨팅(Edge Computing)**: IoT 기기 근처에서 1차 데이터 처리(지연·대역폭 절감). > **시험 핵심**: MapReduce/HDFS/Hive·NoSQL 4유형·CAP·람다 vs 카파는 빅데이터 인프라 단원의 핵심 출제 포인트입니다. ### 빅데이터 활용 방법과 분석 기법 URL: https://adsp.todaycode.kr/study/10 태그: DBMS, 빅데이터, 빅데이터 활용, 분석 주제 유형, 기술통계, 회귀분석, 인공신경망, 군집분석, 연관분석, 차원 축소, R 프로그래밍, 데이터 마트, 거리 측정, IoT·플랫폼, 추천 시스템, 유전 알고리즘, 하둡·빅데이터 인프라 빅데이터를 활용하는 대표적인 분석 기법들이 있으며, 시험에서는 각 기법의 정의와 적용 사례를 정확히 구분할 수 있는지를 묻습니다. 연관규칙학습(Association Rule Learning)은 데이터 변수 간의 의미 있는 연관관계를 발견하는 분석입니다. "기저귀를 사는 고객이 맥주도 함께 산다"는 유명한 장바구니 분석이 대표적 사례입니다. "커피를 구매한 사람이 탄산음료도 구매할지 예측"하는 것도 연관분석에 해당합니다. 유형분석(Clustering)은 사용자의 특성에 맞게 그룹이나 범주로 나누어 분류하는 것으로, 고객 세분화가 대표적입니다. 유전 알고리즘(Genetic Algorithm)은 자연의 진화 과정, 즉 자연선택과 돌연변이 같은 메커니즘을 모방하여 최적의 해답을 점진적으로 찾아가는 방법입니다. "자동차 설계를 세대를 거듭하며 개선하여 연료 효율성을 극대화하는 것"이 대표적인 활용 사례입니다. 기계학습(Machine Learning)은 컴퓨터가 훈련 데이터로부터 스스로 패턴을 파악하여 새로운 데이터에 대해 예측하는 기술로, 넷플릭스의 영상 추천 시스템이 좋은 예입니다. 회귀분석(Regression)은 하나 이상의 독립변수가 종속변수에 미치는 영향을 선형 관계로 분석하는 방법으로, "기온 변화에 따른 제품 판매량 예측"처럼 수치를 예측할 때 사용합니다. 감정분석(Sentiment Analysis)은 텍스트에서 글쓴이의 감정(긍정/부정)을 분석하는 기법으로, 고객 리뷰 분석이나 소셜미디어 여론 파악에 활용됩니다. 시험에서는 각 기법과 활용 사례가 올바르게 연결되었는지를 묻는 문제가 출제됩니다. 예를 들어 "군집분석으로 자동차 설계를 최적화한다"는 유전 알고리즘의 사례이므로 잘못된 연결입니다. --- --- ## 핵심 요약 & 시험 포인트 | 분석 기법 | 설명 | 활용 예시 | |-----------|------|-----------| | **연관규칙학습** | 데이터 변수 간 연관규칙 발견 | 기저귀와 맥주 동시 구매 패턴 | | **유형분석** | 사용자 특성에 맞게 그룹/범주 분류 | 고객 세분화 | | **유전 알고리즘** | 자연선택·돌연변이 메커니즘으로 점진적 진화 | 차량 설계 최적화 | | **기계학습** | 훈련 데이터에서 패턴 파악 후 예측 | 넷플릭스 추천 | | **회귀분석** | 선형함수 기반 수치 데이터 분석 | 기온→판매량 예측 | | **감정분석** | 텍스트에서 감정(긍정/부정) 추출 | 고객 리뷰 분석 | > **시험 포인트:** 유전 알고리즘은 "최적화" 문제에 사용됩니다. 연관분석은 "장바구니 분석"의 대표 사례입니다. 회귀분석은 연속형 종속변수를 예측할 때 사용합니다. --- --- ## 추천 시스템 (Recommendation System) 빅데이터의 가장 대표적 활용 사례. 넷플릭스·아마존·유튜브 핵심 기술. ### 1. 협업 필터링 (Collaborative Filtering) 사용자/항목 간 유사성 기반. | 종류 | 원리 | 예시 | |------|------|------| | **사용자 기반(User-based)** | 비슷한 취향의 사용자가 좋아한 항목 추천 | "비슷한 사용자가 본 영화" | | **아이템 기반(Item-based)** | 사용자가 좋아한 것과 비슷한 항목 추천 | "이 책을 본 사람들이 본 다른 책" | | **모델 기반** | 행렬 분해(MF, SVD), 신경망 | Netflix Prize 우승 알고리즘 | ### 2. 콘텐츠 기반 (Content-based) - 항목의 속성·태그·텍스트로 유사도 계산 - 사용자 프로파일 + 항목 프로파일 매칭 - 예: 유튜브의 동영상 메타데이터 기반 추천 ### 3. 하이브리드 (Hybrid) - 협업 필터링 + 콘텐츠 기반 결합 - 단일 방법의 약점 보완 (Netflix, YouTube) ### 추천 시스템의 주요 문제 | 문제 | 설명 | 해결 | |------|------|------| | **콜드스타트(Cold Start)** | 새 사용자/항목 정보 없음 | 인기 항목, 콘텐츠 기반, 인구통계 활용 | | **희소성(Sparsity)** | 평점 행렬이 대부분 비어있음 | 행렬 분해, 차원 축소 | | **확장성(Scalability)** | 사용자·항목 수 증가 시 계산 비용↑ | 분산 컴퓨팅, 근사 알고리즘 | | **필터 버블** | 유사 항목만 추천되어 다양성 감소 | 무작위성 도입, 다양성 가중치 | ## 빅데이터 처리 단계 5단계 | 단계 | 활동 | 주요 도구 | |------|------|----------| | 1. **수집(Collection)** | 다양한 소스에서 데이터 확보 | Crawler, API, IoT, ETL | | 2. **저장(Storage)** | 분산 저장, 데이터 레이크 | HDFS, S3, NoSQL (MongoDB, Cassandra) | | 3. **처리(Processing)** | 정제·변환·통합 | Spark, MapReduce, Flink | | 4. **분석(Analysis)** | 통계·ML·딥러닝 | R, Python, TensorFlow, scikit-learn | | 5. **시각화(Visualization)** | 결과 표현·공유 | Tableau, PowerBI, ggplot, D3.js | > **시험 포인트**: 협업 필터링 = 유사 사용자/항목, 콘텐츠 기반 = 항목 속성. 콜드스타트 문제는 신규 사용자/항목 정보 부족. ### Hadoop 생태계 확장 - **HDFS**: 분산 파일 시스템 (Hadoop Distributed File System) - **YARN**: 자원 관리 + 작업 스케줄링 (Yet Another Resource Negotiator) - **MapReduce**: 분산 일괄 처리 프레임워크 - **Hive**: SQL on Hadoop (HQL) - **Pig**: 데이터 흐름 언어(Pig Latin) — ETL에 강점 - **HBase**: 컬럼 기반 NoSQL — HDFS 위에서 동작 - **Sqoop**: RDBMS ↔ Hadoop 데이터 전송 - **Flume**: 로그·이벤트 데이터 수집(스트리밍) - **Kafka**: 분산 메시지 큐 — 실시간 스트림 파이프라인 - **Spark**: 인메모리 분산 처리 — MapReduce보다 100배 빠른 경우 있음 - **Impala / Tez**: 저지연 SQL 엔진 — Hive보다 빠른 쿼리 ### 저장소 아키텍처 - **데이터 레이크(Data Lake)**: 원천 데이터를 가공 없이 저장 — Schema on Read - **데이터 웨어하우스(DW)**: 정제·통합된 분석용 저장소 — Schema on Write - **데이터 마트(Data Mart)**: 부서·주제별 소규모 DW - **OLTP / OLAP**: 트랜잭션 처리 / 분석 처리 - **ETL / ELT**: 추출·변환·적재 / 추출·적재·변환(클라우드 시대 ELT 증가) ### 데이터 수집 방법 - **크롤링(Crawling)**: 웹 페이지를 자동 순회하며 데이터 수집 — 검색 엔진의 핵심 기술 - **웹 스크래핑(Web Scraping)**: 특정 페이지에서 원하는 데이터만 추출 - **RSS(Really Simple Syndication)**: 콘텐츠 변경사항을 구독 형태로 받는 XML 기반 포맷 - **API 수집**: 공공데이터포털·Twitter API·Open API 등 정형 인터페이스로 수집 - **로그 수집**: 서버·앱·디바이스에서 발생하는 이벤트 로그 수집 (Flume·Logstash·Fluentd) - **스트리밍(Streaming) 수집**: 실시간 데이터 흐름 처리 (Kafka·Kinesis·Storm) - **센서·IoT 데이터**: RFID·GPS·온도·가속도 등 사물에서 생성된 데이터 ### 머신러닝 학습 유형 - **지도학습(Supervised Learning)**: 입력-정답 쌍으로 학습 — 분류·회귀 - **비지도학습(Unsupervised Learning)**: 정답 없이 패턴 탐색 — 군집·차원축소·연관규칙 - **준지도학습(Semi-supervised Learning)**: 일부만 라벨된 데이터로 학습 — 라벨링 비용 절감 - **강화학습(Reinforcement Learning)**: 보상을 최대화하는 정책 학습 — AlphaGo·자율주행 ### 데이터 기반 의사결정 - **Data-driven Decision Making**: 직관·경험이 아닌 데이터 분석 결과로 의사결정 - **비즈니스 인텔리전스(BI)**: 데이터 → 정보 → 인사이트로 가공해 경영 의사결정을 지원하는 체계 - **데이터 분석가 / 데이터 엔지니어 / 데이터 사이언티스트**: 데이터 직무 3대 유형 ### 분석 4단계 영역 (Gartner) - **기술 분석(Descriptive Analytics)**: 무슨 일이 일어났는가? — 과거 데이터 요약·집계·시각화 - **진단 분석(Diagnostic Analytics)**: 왜 일어났는가? — 원인 분석·드릴다운·상관 분석 - **예측 분석(Predictive Analytics)**: 무엇이 일어날 것인가? — 회귀·분류·시계열 모형 - **처방 분석(Prescriptive Analytics)**: 무엇을 해야 하는가? — 최적화·시뮬레이션·의사결정 자동화 - 분석 성숙도가 높아질수록 가치는 커지지만 복잡도·요구 데이터·기술 수준도 함께 상승 ### 빅데이터 활용 사례 추가 - **수요 예측(Demand Forecasting)**: 시계열·회귀로 매출·재고·인력 수요 예측 - **이상 탐지(Anomaly Detection)**: 정상 패턴에서 벗어난 사건 식별 — 사기·고장·보안 위협 - **장바구니 분석(Market Basket Analysis)**: 함께 구매되는 상품 패턴 — 연관규칙(Apriori) 기반, 상품 진열·교차판매에 활용 - **헬스케어(Healthcare)**: 진단·예후 예측·이미지 판독·신약 개발에 ML/DL 활용 - **신용평가(Credit Scoring)**: 로지스틱 회귀·앙상블로 부도 확률 예측 - **개인화·맞춤 추천(Personalization)**: 사용자별 콘텐츠·상품 추천 ### Spark 핵심 개념 - **RDD(Resilient Distributed Dataset)**: Spark의 기본 데이터 추상화 — 분산·불변·복원 가능한 데이터셋 - **DataFrame API**: SQL 친화적인 구조화 데이터 처리 인터페이스 — Catalyst 옵티마이저로 자동 최적화 - **Spark의 구성**: Spark Core + Spark SQL + Spark Streaming + MLlib + GraphX - **YARN/Mesos/K8s 위에서 동작**: 다양한 자원 관리자와 통합 ### MapReduce 처리 추가 - **JobTracker / TaskTracker**: 1세대 Hadoop의 작업 스케줄러·실행기 (YARN으로 대체) - **NameNode / DataNode / Secondary NameNode**: HDFS의 메타데이터·실제 데이터·메타 백업 노드 ### 운영계 vs 분석계 - **운영계(Operational System) 데이터**: 일상 업무 처리(OLTP)에서 생성·갱신되는 데이터 — 실시간 거래 - **분석계(Analytics) / 정보계(Information System) 데이터**: 의사결정 지원을 위해 가공·통합·축적된 데이터 — DW·DM·OLAP - **분석용 데이터**: 분석계로 옮겨져 정제·표준화된 데이터셋 - 데이터 흐름: 운영계 → ETL → DW → DM → BI/분석 ### 빅데이터 활용 사례 추가 - **예지보전(Predictive Maintenance)**: 센서 데이터로 장비 고장을 사전 예측 → 다운타임·수리비 절감 - **고장 예측**: 진동·온도·전류 패턴 변화를 ML로 감지 - **사용자 행동(User Behavior) 분석**: 클릭·체류·전환 등 디지털 흔적으로 의도·관심 추론 → UX 개선·개인화 - **재난 예측·기상 예측**: 위성·센서 데이터로 태풍·홍수·산불 위험 사전 경보 - **VOC(Voice of Customer) 분석**: 리뷰·고객센터 대화 분석으로 제품·서비스 개선 ### 데이터 수집 방식 분류 - **온라인 vs 오프라인 수집**: 인터넷 기반 자동 수집 vs 종이·인터뷰 등 수동 수집 - **실시간 vs 배치 수집**: 발생 즉시 수집(스트리밍) vs 일정 주기 일괄 수집 ### 빅데이터 처리 전체 흐름 - **수집(Collection) → 저장(Storage) → 처리(Processing) → 분석(Analysis) → 활용(Utilization)** 5단계 - 각 단계에서 사용되는 기술이 다름: - 수집: Flume·Kafka·Sqoop·Scrapy - 저장: HDFS·S3·NoSQL - 처리: MapReduce·Spark·Tez - 분석: R·Python·Tableau - 활용: BI·대시보드·API ### 데이터 시장 - **데이터 거래소(Data Marketplace)**: 데이터를 구매·판매할 수 있는 플랫폼 — KDX 한국데이터거래소 등 - **데이터 거래(Data Trade)**: 데이터의 가치를 인정하고 자산처럼 매매 - **마이데이터(MyData)**: 정보주체가 본인 데이터의 활용 권리를 행사 ### 빅데이터 저장 방식 - **Schema-on-Write**: 저장 시 스키마 정의 (전통 DW) — 정합성 좋음, 유연성 낮음 - **Schema-on-Read**: 읽을 때 스키마 적용 (데이터 레이크) — 원본 그대로 저장, 유연성·확장성 ### 공급망에서의 빅데이터 - **채찍 효과(Bullwhip Effect)**: 수요 정보가 공급망 상류로 갈수록 변동이 증폭되는 현상 — 빅데이터·실시간 공유로 완화 ### 새 컴퓨팅 패러다임 - **포그 컴퓨팅(Fog Computing)**: 클라우드와 엣지 사이 중간 계층 — 데이터를 네트워크 가장자리에서 처리 - **분산 원장(Distributed Ledger) / 블록체인(Blockchain)**: 데이터 무결성·신뢰의 분산 저장 기술 ### 데이터 웨어하우스 핵심 특성 - **주제 지향성(Subject-Oriented)**: 비즈니스 주제별 구성 - **통합성(Integrated)**: 여러 원천에서 통합 - **시불변성(Time-Variant)**: 시계열 기록 보존 - **비휘발성(Non-volatile)**: 한 번 저장된 데이터는 변경되지 않음 (Inmon DW의 4대 특성) ### 유전자 알고리즘(GA) 상세 절차 - **유전자 알고리즘(Genetic Algorithm)**: 생물 진화 원리를 모방한 메타휴리스틱 최적화 - **6단계 절차**: 1. **초기 해집단(Initial Population) 생성**: 무작위 후보해 N개 생성 2. **적합도 평가(Fitness Evaluation)**: 각 해의 목적함수 값 계산 3. **선택(Selection)**: 적합도 비례 확률로 부모 선택 (룰렛휠·토너먼트) 4. **교차(Crossover)**: 두 부모 해를 결합해 자식 해 생성 (One-point·Two-point·Uniform) 5. **변이(Mutation)**: 자식 해 일부를 무작위 변경 — 지역 최적 탈출 6. **세대(Generation) 반복**: 종료 조건까지 반복 - **염색체(Chromosome) / 유전자(Gene)**: 해의 표현 단위 - **해집단(Population)**: 한 세대의 모든 후보해 모음 ### GA 활용 사례 - **외판원 문제(TSP, Travelling Salesman Problem)**: 최소 거리 경로 탐색 - **차량 설계 최적화**: 연료 효율 극대화 - **일정 최적화**: 자원·시간 제약 하의 스케줄링 - **신경망 구조 탐색(NAS)**: 신경망 아키텍처 자동 설계 ### 웹 데이터 수집 도구 - **BeautifulSoup**: Python의 HTML/XML 파싱 라이브러리 — 정적 페이지에 적합 - **Selenium**: 실제 브라우저를 제어해 동적 페이지 수집 — JS 렌더링 필요한 페이지 - **Scrapy**: 대규모 크롤링 프레임워크 — 비동기·확장성 - **Requests**: Python HTTP 클라이언트 — API 호출의 기본 ### Lakehouse 아키텍처 - **데이터 레이크하우스(Data Lakehouse)**: 데이터 레이크 + DW의 장점 결합 - 저장: 객체 스토리지(저렴·확장) - 트랜잭션·스키마: ACID 보장 - SQL·ML 워크로드 모두 지원 - **오픈 테이블 포맷**: - **Delta Lake**: Databricks 주도 — Spark 친화적 - **Apache Iceberg**: Netflix 발 — 광범위한 엔진 지원 - **Apache Hudi**: 실시간 업서트 강점 ### 검색·분석 엔진 - **Elasticsearch**: 분산 검색·분석 엔진 — Lucene 기반 - **OpenSearch / Solr**: 검색 엔진 대안 - **Druid / ClickHouse / Pinot**: 실시간 OLAP 분석 DB ### 공간 데이터·GIS - **GIS(Geographic Information System, 지리정보시스템)**: 공간 데이터를 저장·분석·시각화하는 시스템 - **공간 분석(Spatial Analysis)**: 위치·근접성·공간 패턴 분석 - **공간 데이터**: 점(Point)·선(Line)·면(Polygon) — 위도(Latitude)·경도(Longitude) 좌표 - **지오코딩(Geocoding)**: 주소 → 좌표 변환 - **역지오코딩(Reverse Geocoding)**: 좌표 → 주소 변환 - **GeoIP**: IP 주소로 위치 추정 - **공간 통계**: Moran's I·Getis-Ord Gi* — 공간 자기상관 측정 - **공간 인덱스**: R-tree·Quadtree·Geohash — 공간 검색 가속화 ### 시뮬레이션과 확률 - **시뮬레이션(Simulation)**: 모델을 통해 실제 시스템 행동을 모방 - **몬테카를로 시뮬레이션(Monte Carlo Simulation)**: 무작위 표본으로 적분·확률 추정 - **이산 사건 시뮬레이션(Discrete Event Simulation)**: 사건이 이산 시점에 발생하는 시스템 모형 - **시스템 다이내믹스(System Dynamics)**: 피드백 루프·시간 지연을 가진 시스템 모형 ### 분석 활용 영역 - **운영 분석(Operational Analytics)**: 실시간 운영 데이터를 분석해 즉각적 의사결정 — 트랜잭션·서비스 모니터링 - **효과 분석(Impact Analysis)**: 정책·조치·캠페인의 결과 측정 — A/B 테스트·DiD 등 활용 - **수익성 분석(Profitability Analysis)**: 고객·상품·채널별 수익 기여도 측정 ### 분석 접근 방식 추가 - **혼합 분석(Mixed Methods)**: 정량 분석 + 정성 분석을 결합 - 정량: 수치·통계·ML - 정성: 인터뷰·관찰·텍스트 분석 - 양적·질적 데이터를 모두 활용해 한쪽으로는 보이지 않는 통찰 발견 - 예: 매출 데이터 + 고객 인터뷰로 이탈 원인 종합 분석 ### 데이터 종류 추가 - **관리 데이터(Managed Data)**: 거버넌스 하에 표준·품질·보안 관리되는 데이터 - 운영 데이터와 관리 데이터의 구분: 운영은 처리 대상, 관리는 자산화·통제 ### 데이터웨어하우스·데이터레이크 (한 단어 표기) - **데이터웨어하우스(DW, Data Warehouse)**: 정제·통합·축적된 분석용 데이터 저장소 - Schema-on-Write: 저장 시 스키마 정의 - SQL 분석에 최적화 - **데이터레이크(Data Lake)**: 원본 데이터를 가공 없이 저장 - Schema-on-Read: 읽을 때 스키마 적용 - 비정형·반정형 데이터 포함 - **데이터마트(DM, Data Mart)**: 부서·주제별 소규모 DW - **데이터 레이크하우스(Lakehouse)**: 데이터 레이크 + DW 장점 결합 (Delta Lake·Iceberg·Hudi) ### 의사결정 지원 시스템 - **DSS(Decision Support System, 의사결정 지원 시스템)**: 데이터·모델·시뮬레이션으로 비구조적 의사결정 지원 - **EIS(Executive Information System)**: 경영진 의사결정 지원에 특화 - **BI(Business Intelligence)**: DSS의 확장 — 데이터 → 정보 → 인사이트 → 행동 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **YARN** — 자원 관리 + 작업 스케줄링 (Yet Another Resource Negotiator) - **Pig** — 데이터 흐름 언어(Pig Latin) — ETL에 강점 - **HBase** — 컬럼 기반 NoSQL — HDFS 위에서 동작 - **Sqoop** — RDBMS ↔ Hadoop 데이터 전송 - **Kafka** — 분산 메시지 큐 — 실시간 스트림 파이프라인 - **Impala / Tez** — 저지연 SQL 엔진 — Hive보다 빠른 쿼리 - **ETL / ELT** — 추출·변환·적재 / 추출·적재·변환(클라우드 시대 ELT 증가) - **웹 스크래핑** — 특정 페이지에서 원하는 데이터만 추출 - **센서·IoT 데이터** — RFID·GPS·온도·가속도 등 사물에서 생성된 데이터 - **준지도학습** — 일부만 라벨된 데이터로 학습 — 라벨링 비용 절감 - **진단 분석** — 왜 일어났는가? — 원인 분석·드릴다운·상관 분석 - **DataFrame API** — SQL 친화적인 구조화 데이터 처리 인터페이스 — Catalyst 옵티마이저로 자동 최적화 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터 사이언스와 데이터 사이언티스트 URL: https://adsp.todaycode.kr/study/11 태그: DBMS, 빅데이터, 데이터 사이언스, 분석 주제 유형, 하향식·상향식 접근, 의사결정나무, 데이터 마트, 데이터 기반 의사결정, 강화학습·지도학습, SQL, 하둡·빅데이터 인프라 데이터 사이언스는 정형, 반정형, 비정형 등 다양한 형태의 데이터에서 의미와 가치를 추출하는 학문입니다. 수학, 통계학, 컴퓨터공학, 데이터공학 등을 아우르는 총체적(holistic) 접근법을 사용합니다. 데이터 분석가는 분석 보고서와 시각화 자료를 작성하여 데이터 기반의 의사결정을 돕는 역할을 합니다. 데이터 사이언티스트는 머신러닝 및 AI를 활용하기 위한 코딩 스킬과 통계적 지식을 갖춘 전문가입니다. 필요한 역량은 크게 하드 스킬과 소프트 스킬로 나뉩니다. 하드 스킬에는 머신러닝, 모델링, 데이터 기술 역량 등 기술적 이론 지식이 포함됩니다. 소프트 스킬에는 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션(고객 공감 능력) 등이 포함되며, 이를 통해 통찰력 있는 분석 능력을 발휘합니다. **가트너(Gartner)**가 주장한 데이터 사이언티스트의 핵심 역량은 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 네 가지이며, 여기서 주의할 점은 하드 스킬이 포함되지 않는다는 것입니다. 또한 시험에서 "타인과의 의사소통 능력은 중요하지 않다"는 보기가 나오면 반드시 틀린 것입니다. 데이터 사이언티스트에게 커뮤니케이션 능력은 필수적인 소프트 스킬입니다. 효과적인 분석 모델 개발을 위해서는 인문학적 요소도 중요합니다. 분석 모델이 예측할 수 없는 위험 요소를 지속적으로 판단하고, 모델의 한계에 대해 끊임없이 의구심을 가져야 합니다. 과학 기반의 정량 분석과 인문학적 통찰을 결합한 합리적 추론이 필요하며, 특히 인과관계보다 상관관계 분석 기반의 인사이트가 중요해지고 있습니다. --- --- ## 핵심 요약 & 시험 포인트 ### 데이터 사이언스 - 다양한 형태의 데이터에서 의미/가치를 추출하는 학문 - **총체적(holistic) 접근법**: 수학, 통계학, 컴퓨터공학, 데이터공학 등 융합 - 데이터 분석가: 분석 보고서·시각화 자료 작성 → 데이터 기반 의사결정 ### 데이터 사이언티스트 역량 | 구분 | 내용 | |------|------| | **하드 스킬** | Machine Learning, Modeling, Data Technical Skill | | **소프트 스킬** | 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션 | > 시험 포인트: > - 가트너 주장 역량: 데이터 관리, 분석 모델링, 비즈니스 분석, **소프트 스킬** (하드 스킬 **제외**) > - 의사소통 능력은 중요합니다 — "의사소통이 중요하지 않다"는 **틀린 설명** (47회 출제) > - 인문학적 요소: 분석 모델의 한계를 끊임없이 고찰, '상관관계' 분석 기반 인사이트 중시 ### 가치 패러다임의 변화 ``` Digitalization → Connection → Agency (아날로그→디지털) (연결 지향) (자율적 의사결정) ``` --- --- ## 데이터 사이언티스트 역량 — Hard Skills vs Soft Skills ### Hard Skills (분석 기술 역량) | 영역 | 세부 역량 | |------|----------| | **통계·수학** | 통계학, 선형대수, 미적분 | | **머신러닝** | 지도/비지도 학습 알고리즘, 평가 | | **분석 도구** | R, Python, SQL, Spark | | **빅데이터 인프라** | Hadoop, Spark, NoSQL, 클라우드 | | **데이터 엔지니어링** | ETL, 데이터 파이프라인 | ### Soft Skills (커뮤니케이션·통찰 역량) | 영역 | 세부 역량 | |------|----------| | **비즈니스 도메인 지식** | 산업 이해, 도메인 인사이트 | | **호기심·창의력** | 문제 정의, 가설 수립 | | **스토리텔링** | 분석 결과를 이해하기 쉽게 전달 | | **시각화** | 비전문가도 이해할 수 있는 그래프 | | **협업·소통** | 다양한 부서·전문가와 협업 | > **시험 포인트**: ADsP에서 "데이터 사이언티스트는 Hard Skills만 갖추면 된다"는 보기는 **틀림**. Soft Skills가 동등하게 중요. 통찰력·스토리텔링·창의성이 핵심. --- ## 추가 핵심 개념 — 데이터 사이언티스트의 역할 확장 - **CDO(Chief Data Officer)**: 조직의 데이터 전략·자산을 총괄하는 임원으로 데이터 거버넌스의 최상위 책임자. - **Data Owner**: 특정 데이터 도메인의 비즈니스 책임자(현업 부서). 데이터 정의·접근 권한 결정. - **Data Steward**: 데이터 품질·표준·메타데이터를 실무적으로 관리하는 역할(분석가·DBA 협업). - **Data Custodian**: 데이터 저장·보안·백업·운영을 책임지는 IT 기술 담당. - **알고리즈미스트(Algorithmist)**: 알고리즘의 공정성·투명성을 감시하고 피해자 입장에서 알고리즘을 검증하는 새로운 직업군. 빅데이터 위기 요인 "데이터 오용"의 통제 수단. - **디지털 전환(DX, Digital Transformation)**: 단순 디지털화(Digitization)·디지털 업무화(Digitalization)를 넘어 비즈니스 모델·문화·고객 경험을 근본 혁신. Netflix·Uber가 대표 사례. > **시험 핵심**: CDO·Data Owner·Data Steward·Custodian의 역할 구분과 알고리즈미스트는 거버넌스·윤리 문제와 결합되어 자주 출제됩니다. ### 데이터 직무·조직 명칭 - **데이터 사이언티스트(Data Scientist)**: 통계·ML·도메인 지식을 결합해 데이터에서 비즈니스 가치 창출 - **CDO(Chief Data Officer)**: 최고데이터책임자 — 데이터 전략·거버넌스·품질·활용 총괄 - **데이터 거버넌스 역할군**: Data Owner(소유자), Data Steward(관리자), Data Architect(설계자) ### 설명가능 AI (XAI) - **XAI(Explainable AI)**: 모델 예측 근거를 사람이 이해할 수 있도록 설명 - **SHAP**: 각 특성의 기여도를 게임이론(Shapley value) 기반으로 계산 - **LIME**: 특정 예측 주변을 단순 모델로 근사해 설명 - **공정성(Fairness) / 알고리즘 편향**: 학습 데이터·모델이 특정 집단에 불리한 결정을 내리지 않도록 진단·완화 ### 데이터 사이언티스트의 도구 - **시각화 도구**: - **Tableau**: 드래그-앤-드롭 BI, 대시보드 표준 - **Power BI**: 마이크로소프트 BI 플랫폼, Excel 친화 - **QlikView / QlikSense**: 연관 모델 기반 BI - **Looker / Superset**: 클라우드 BI - **분석 환경**: - **Jupyter Notebook**: 셀 단위 실행, Python·R·Julia 지원 - **Anaconda**: 과학 컴퓨팅 패키지 배포판 - **Colab**: 구글 클라우드 무료 Jupyter — GPU 제공 - **MLOps**: - **Docker / Kubernetes**: 컨테이너화·오케스트레이션 - **Airflow**: 워크플로 스케줄링 - **MLflow / Kubeflow**: ML 라이프사이클 관리 ### 데이터 사이언티스트 역량 - **Hard Skill(하드 스킬)**: 통계·수학·프로그래밍·머신러닝·DB·도구 활용 등 기술적 역량 - **Soft Skill(소프트 스킬)**: 분석적 사고·비판적 사고·호기심·커뮤니케이션·스토리텔링·도메인 이해 - **다분야 협력(Cross-functional Collaboration)**: 개발·마케팅·도메인 전문가와의 협업 - **분석적 사고(Analytical Thinking)**: 문제를 구조화하고 데이터로 검증 - **스토리텔링(Storytelling)**: 분석 결과를 직관적으로 전달하는 능력 - **통찰력(Insight)**: 데이터 너머의 의미와 함의를 발견하는 능력 ### 데이터 거버넌스 직무 역할 (상세) - **Data Owner(데이터 오너)**: 해당 데이터의 사업적 책임자 — 정의·접근·품질 책임 - **Data Steward(데이터 스튜어드)**: 데이터 표준·메타데이터·품질을 관리하는 실무 운영자 - **Data Custodian(데이터 관리자)**: 물리적 저장·백업·보안 등 기술적 관리 책임 - **Data Architect(DA)**: 전사 데이터 모델·구조 설계 - **DBA(Database Administrator)**: DBMS 운영·튜닝·백업 ### 분석 가치사슬과 데이터 직무 - 데이터 엔지니어(수집·파이프라인) → 데이터 분석가(탐색·보고) → 데이터 사이언티스트(모델링) → ML 엔지니어(배포·운영) ### Python 분석 라이브러리 - **NumPy**: 다차원 배열·선형대수 — Python 과학컴퓨팅의 기초 - **Pandas**: DataFrame·Series — 표 형식 데이터 조작의 표준 - **Scikit-learn**: 머신러닝 알고리즘 모음 — 분류·회귀·군집·전처리·평가 - **TensorFlow / PyTorch / Keras**: 딥러닝 프레임워크 — Keras는 TF/Theano 위의 고수준 API - **matplotlib / seaborn / plotly**: 시각화 라이브러리 ### 데이터 분석 직무 세부 - **데이터 분석가(Data Analyst)**: 비즈니스 질문에 답하는 보고·시각화·EDA - **데이터 엔지니어(Data Engineer)**: 데이터 파이프라인·인프라 구축 - **ML 엔지니어(MLE)**: 모델 학습·배포·운영 - **데이터 분석 컨설턴트**: 외부 컨설팅·전략 수립 ### 분석 환경 - **개발 환경 / 운영 환경 / 분석 샌드박스(Sandbox)**: 분석 코드 실험·검증을 위한 격리된 영역 ### T자형 / Π자형 인재 - **T자형(T-shaped) 인재**: 한 분야에 깊은 전문성(수직 막대) + 다양한 분야 이해(가로 막대) - 데이터 사이언티스트는 통계/ML 전문성 + 도메인·비즈니스 이해 - **Π자형(Pi-shaped) 인재**: 두 분야 이상의 깊은 전문성 + 폭넓은 이해 — 더 진화된 형태 - **I자형 인재**: 한 분야만 깊은 전형적 전문가 — 협업·확장성 부족 ### 도메인 지식 - **Domain Knowledge(도메인 지식)**: 분석 대상 산업·업무에 대한 이해 - 데이터 사이언티스트의 성공은 통계·코딩 기술만큼 도메인 이해에 좌우 — 변수 선택·결과 해석·의사결정 모두에 영향 - **Stakeholder(이해관계자)** 관리 능력도 필수 역량 ### 분석 문화 확산 - **데이터 리터러시(Data Literacy)**: 데이터를 읽고·해석하고·활용하는 능력 — 전사적 분석 문화의 기반 - 데이터 리터러시 교육은 분석 성숙도 향상의 핵심 활동 - **CoE(Center of Excellence)**: 분석 전문 조직 — 표준·교육·플랫폼 제공 ### 클라우드 데이터 웨어하우스 - **Snowflake**: 멀티 클라우드 DW — 컴퓨팅·저장 분리 - **Amazon Redshift**: AWS의 컬럼 기반 DW - **Google BigQuery**: 서버리스 DW — 페타바이트급 SQL 분석 - 모두 SaaS 형태, 빠른 SQL 분석에 특화 ### R 추가 도구 - **R Shiny**: R 기반 대화형 웹 앱 프레임워크 — 분석 결과를 대시보드로 배포 - **Streamlit / Dash**: Python 기반 동등 도구 ### 새로운 데이터 직무 트렌드 - **Citizen Data Scientist(시민 데이터 사이언티스트)**: 비전공자가 AutoML·BI 도구로 분석 수행 — 분석 민주화의 결과 - **Analytics Coordinator(분석 조정자)**: 비즈니스와 분석가 사이의 가교 역할 - **Hardcore Data Scientist**: 알고리즘·통계 깊이 있는 전문가 ### 분석 성공 요인 - **CSF(Critical Success Factor, 핵심 성공요인)**: 프로젝트 성공의 결정적 요인 — 경영진 지원·데이터 품질·도메인 협력·인재 ### 통찰(Insight)의 본질 - **통찰(Insight)**: 데이터 분석을 통해 발견한 비즈니스에 가치를 주는 새로운 이해 - 단순 사실(Fact) → 의사결정에 영향을 주는 통찰로 변환되어야 가치 창출 - 통찰 생성 절차: 데이터 → 정보 → 지식 → **통찰** → 행동(Actionable Insight) ### 삼각측량(Triangulation) - **데이터 삼각측량(Data Triangulation)**: 여러 출처·방법·이론을 결합해 결과의 신뢰성 향상 - 정량 + 정성 데이터의 결합, 다중 모형 검증 - 신뢰성·타당성 확보 기법 ### 데이터 사이언티스트의 핵심 역량 (5대) 1. **분석 역량(Analytical Skill)**: 통계·수학·ML 이론과 적용 2. **기술 역량(Technical Skill)**: SQL·Python·R·빅데이터 도구 3. **비즈니스 역량(Business Skill)**: 도메인 이해·의사결정 지원 4. **커뮤니케이션 역량(Communication Skill)**: 시각화·스토리텔링·발표 5. **협업 능력(Collaboration)**: 다분야·다부서 팀워크 ### 분석 환경 구축 - **데이터 분석 환경(Analytics Environment)**: 분석가가 효율적으로 작업할 수 있는 통합 환경 - 구성 요소: 컴퓨팅 인프라(클러스터·클라우드), 데이터 저장소(DW·DM·Lake), 분석 도구(Jupyter·RStudio), 협업 도구(Git·Wiki) - **분석 인프라(Analytics Infrastructure)**: 분석을 위한 하드웨어·소프트웨어·네트워크의 총체 - **Big Data Platform**: 빅데이터 수집·저장·처리·분석·시각화의 통합 플랫폼 ### 한국어 NLP 사전훈련 모델 - **KoBERT(2019)**: SKTBrain이 공개한 한국어 BERT - **KLUE(Korean Language Understanding Evaluation)**: 한국어 자연어 이해 벤치마크 - **KoGPT**: 카카오브레인의 한국어 GPT - **HyperCLOVA(2021)**: 네이버의 한국어 거대 언어 모델 (Cloud X) - **KoSimCSE / KoBigBird / KoElectra**: 다양한 한국어 사전훈련 모델 ### 분석 인력 양성 체계 - **데이터 분석가 양성 / 분석 인재 양성**: 사내 교육·외부 교육·자격증 지원 - **자격증 트랙**: ADsP(준전문가) → ADP(전문가) → SQLD/SQLP → DAsP/DAP - **외부 교육**: 부트캠프·MOOC(Coursera·edX)·대학원 협력 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **데이터 거버넌스 역할군** — Data Owner(소유자), Data Steward(관리자), Data Architect(설계자) - **공정성(Fairness) / 알고리즘 편향** — 학습 데이터·모델이 특정 집단에 불리한 결정을 내리지 않도록 진단·완화 - **시각화 도구** — **Tableau**: 드래그-앤-드롭 BI, 대시보드 표준 - **Power BI** — 마이크로소프트 BI 플랫폼, Excel 친화 - **Colab** — 구글 클라우드 무료 Jupyter — GPU 제공 - **Data Custodian** — 물리적 저장·백업·보안 등 기술적 관리 책임 - **NumPy** — 다차원 배열·선형대수 — Python 과학컴퓨팅의 기초 - **Pandas** — DataFrame·Series — 표 형식 데이터 조작의 표준 - **Soft Skill** — 분석적 사고·비판적 사고·호기심·커뮤니케이션·스토리텔링·도메인 이해 - **Data Steward** — 데이터 표준·메타데이터·품질을 관리하는 실무 운영자 - **T자형인재** — 한 분야에 깊은 전문성(수직 막대) + 다양한 분야 이해(가로 막대) - **Π자형인재** — 두 분야 이상의 깊은 전문성 + 폭넓은 이해 — 더 진화된 형태 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 빅데이터 시대의 위기와 개인정보 비식별화 URL: https://adsp.todaycode.kr/study/12 태그: 빅데이터, 개인정보, 분석 기획 빅데이터 시대에는 세 가지 주요 위기 요인이 있습니다. 첫째, 사생활 침해입니다. 대량의 개인정보가 수집·분석되면서 개인의 프라이버시가 위협받을 수 있습니다. 이에 대한 통제 방안으로 정보 제공자의 동의제에서 데이터 사용자의 책임제로 전환하는 것이 논의되고 있습니다. 여기서 주의할 점은 "익명화 기술로 사생활 침해를 완전히 해결할 수 있다"는 설명은 틀렸다는 것입니다. 익명화 기술은 도움이 되지만 완전한 해결책은 아닙니다. 둘째, 책임 원칙 훼손입니다. 예측 알고리즘이 발달하면서 실제 행위가 아닌 잠재적 성향만으로 불이익을 받는 등 '행위에 따른 책임'이라는 원칙이 흔들릴 수 있습니다. 이에 대한 통제 방안은 결과 기반 책임 원칙을 고수하는 것입니다. 셋째, 데이터 오용입니다. 데이터를 과신하거나 잘못된 지표로 해석해 그릇된 판단을 내릴 위험이 있으며, 이에 대해서는 알고리즘 접근권을 허용하고 객관적인 인증 방안을 도입하는 것(알고리즈미스트)이 통제 방안입니다. 개인정보 비식별화 기술도 중요한 시험 주제입니다. **범주화(Generalization)**는 상세한 값을 일반적인 범주로 바꾸는 기법으로, 예를 들어 "25세"를 "20대"로 변환합니다. **가명처리(Pseudonymization)**는 실제 정보 대신 가짜 이름이나 값으로 대체하는 기법입니다. **총계처리(Aggregation)**는 개별 값 대신 전체 집계 값(합계, 평균 등)을 사용하는 기법입니다. **데이터 마스킹(Data Masking)**은 특정 식별 가능한 데이터 값을 다른 값으로 대체하는 기법입니다. 시험에서 "데이터 마스킹은 특정 데이터 값을 삭제하는 기법"이라는 보기가 나오면, 삭제가 아닌 대체이므로 주의해야 합니다. 이 밖에도 **데이터 삭제(Data Suppression)**는 식별 가능한 정보를 완전히 제거하는 기법이며, **랜덤 라운딩(Random Rounding)**은 수치 데이터를 무작위로 올리거나 내려 정확한 값을 숨기는 기법입니다. **재배열(Shuffling)**은 데이터 속성값을 같은 열 내에서 무작위로 섞어 연결 고리를 끊는 기법입니다. --- # 제2과목 — 데이터 분석 기획 --- --- ## 핵심 요약 & 시험 포인트 | 위기 요인 | 통제 방안 | |-----------|-----------| | **사생활 침해** | 동의제 → **책임제**로 전환 | | **책임 원칙 훼손** | **결과 기반 책임 원칙** 고수 | | **데이터 오용** | 알고리즘 접근권 허용, 객관적 인증 방안 도입 (알고리즈미스트) | > **시험 포인트:** "익명화 기술로 사생활 침해를 완전 해결할 수 있다"는 **틀린 설명**입니다 (44회 출제). 위기 요인과 통제 방안의 연결을 정확히 외워야 합니다. --- --- ## 빅데이터 시대의 위기 요인 3가지 + 통제 방안 | 위기 | 내용 | 통제 방안 | |------|------|----------| | **사생활 침해 (Privacy Invasion)** | 무분별한 개인정보 수집·결합으로 익명성 상실 | **동의제 → 책임제** 전환, 비식별화 강화 | | **책임 원칙 훼손 (Accountability Erosion)** | 알고리즘 자동 판단의 책임 소재 모호 | **결과 기반 책임 부과**, 감사 가능성 | | **데이터 오용 (Data Misuse)** | 잘못된 분석·해석으로 그릇된 의사결정 | **알고리즘 접근권 보장**, 투명성 확보 | ### 사생활 침해 - 사례 - 통신사 위치 데이터로 개인 행적 추적 - SNS 공개 정보 결합으로 신원 식별 ### 책임 원칙 훼손 - 사례 - AI 채용 알고리즘이 특정 집단을 차별 - 자율주행차 사고 시 책임 소재 불명 ### 데이터 오용 - 사례 - 잘못된 모델로 보험료 차별 산정 - 통계적 편향이 있는 데이터로 의사결정 > **시험 포인트**: 위기 3가지(사생활/책임/오용)와 각 통제 방안의 매핑이 자주 출제됨. "동의제→책임제", "결과 기반 책임", "알고리즘 접근권"은 빈출 키워드. --- ## 추가 핵심 개념 — 프라이버시 보호 모델 (k-익명성·l-다양성·t-근접성) - **k-익명성(k-Anonymity)**: 동일한 준식별자(Quasi-identifier: 나이·성별·우편번호 등) 조합을 가진 레코드가 데이터셋에 최소 **k개 이상** 존재하도록 보장하는 비식별화 모델. k가 클수록 프라이버시 ↑, 데이터 유용성 ↓. - **l-다양성(l-Diversity)**: k-익명성의 "동질성 공격"(같은 그룹 내 민감 속성이 모두 동일하면 추론 가능) 취약점 보완. 동질 집단 내 민감 속성에 최소 **l가지** 이상 다양한 값 존재. - **t-근접성(t-Closeness)**: l-다양성의 "편향 공격" 취약점 보완. 그룹 내 민감 속성 분포가 전체 분포와 **t 이하 차이**가 되도록 통제. - **차분 프라이버시(Differential Privacy)**: 통계 결과에 무작위 노이즈(라플라시안·가우시안)를 추가해 개별 레코드의 포함 여부를 사실상 식별 불가능하게 만드는 강건한 보호 기법. ε(엡실론)이 작을수록 보호 강함. - **GDPR(General Data Protection Regulation)**: EU의 개인정보보호 규정(2018). 정보주체 7대 권리: 접근권·정정권·삭제권(잊힐 권리)·이동권·처리제한권·반대권·자동화 결정 거부권. 위반 시 최대 매출의 4% 또는 2천만 유로. - **CCPA(California Consumer Privacy Act)**: 캘리포니아 소비자 프라이버시법(2020). 미국판 GDPR 성격. - **데이터 3법(국내, 2020 개정)**: 개인정보보호법·신용정보법·정보통신망법. **가명정보** 도입으로 통계·과학연구·공익 목적의 동의 없는 활용 가능. > **시험 핵심**: k-익명성 → l-다양성 → t-근접성 → 차분 프라이버시로 발전한 보완 관계와 각 방어 공격(연결·동질·편향)이 자주 출제됩니다. ### 비식별 처리 추가 기법 - **익명화(Anonymization)**: 개인 식별 불가능한 형태로 영구 변환 — 원본 복원 불가 - **가명화(Pseudonymization)**: 식별자를 가명(코드)으로 대체 — 별도 매핑정보로 재식별 가능, GDPR이 인정하는 보호 기법 - **차분 프라이버시(Differential Privacy)**: 결과에 잡음을 추가해 개인 정보가 미치는 영향을 수학적으로 제한 - **동형암호(Homomorphic Encryption)**: 암호화된 상태에서 연산이 가능한 암호 — 의료·금융 데이터 안전 분석에 활용 ### 데이터 보호 기법 추가 - **암호화(Encryption)**: 데이터를 키로 변환 — 키 없이는 복호화 불가 - **데이터 마스킹(Data Masking)**: 식별자의 일부/전체를 *·X 등으로 가림 (예: 김\*\*, 010-\*\*\*\*-1234) - **토큰화(Tokenization, 보안)**: 민감 데이터를 의미 없는 토큰으로 대체 후 별도 저장소에서 매핑 — 결제·의료에 활용 - **정보주체(Data Subject)**: 정보의 본인 - **처리자(Processor) / 관리자(Controller)**: GDPR 용어 — 데이터를 위탁받아 처리 vs 처리 목적·방법 결정 ### 프라이버시 보호 모델 - **k-익명성(k-Anonymity)**: 동일한 준식별자 조합을 가진 레코드가 최소 k개 존재하도록 일반화·삭제. k가 클수록 익명성↑ - 한계: 동질성 공격(Homogeneity Attack)에 취약 - **l-다양성(l-Diversity)**: 각 동치류(equivalence class)에 민감 속성 값이 최소 l개 — 동질성 공격 완화 - **t-근접성(t-Closeness)**: 동치류 내 민감 속성 분포가 전체 분포와 t 이하 차이 — 배경지식 공격까지 방어 - **재식별 위험**: 익명화된 데이터가 외부 데이터와 결합되어 개인을 다시 식별할 위험 ### 프라이버시 영향평가 - **PIA(Privacy Impact Assessment, 개인정보 영향평가)**: 새로운 시스템·서비스 도입 시 개인정보 침해 위험을 사전 평가 - **DPIA(Data Protection Impact Assessment)**: GDPR의 영향평가 — 고위험 처리 시 의무 ### 비식별화 대상 분류 - **식별자(Identifier)**: 개인을 직접 식별 — 주민번호·전화번호·계좌번호 (반드시 삭제·암호화) - **준식별자(Quasi-Identifier)**: 단독으로는 식별 불가하나 결합 시 식별 가능 — 성별·생년월일·우편번호·직업 - **민감 정보(Sensitive Attribute)**: 보호 대상 속성 — 질병·정치 성향·종교·성적 지향 ### 비식별화 기법 추가 - **총계처리(Aggregation)**: 개별 값을 합계·평균 등으로 대체 - **범주화(Categorization)**: 연속값을 구간으로 일반화 (나이 32 → 30대) - **Static Masking / Dynamic Masking**: 사전 일괄 마스킹 / 조회 시 실시간 마스킹 - **포맷 보존 암호화(FPE, Format-Preserving Encryption)**: 원래 길이·형식을 유지하며 암호화 ### 재식별 위험 - **재식별 가능성(Re-identification Risk)**: 익명화된 데이터가 외부 데이터와 결합되어 다시 식별될 위험 - 비식별 조치 적정성 평가의 핵심 지표 ### 비식별 조치 4단계 (개인정보보호위원회 가이드) 1. **사전 검토**: 처리 대상 데이터에 개인정보·민감정보가 포함되었는지 확인 2. **비식별 조치**: 가명·총계·삭제·범주화·마스킹 등 적용 3. **적정성 평가**: 외부 평가단이 재식별 위험 검토 (k-익명성 등 지표) 4. **사후 관리**: 정기적 재식별 위험 모니터링, 추가 조치 ### 비식별 조치의 한계 - 완벽한 익명화는 어렵고, 외부 데이터와 결합 시 재식별 가능성 존재 - 데이터 활용 가치와 보호 수준 사이의 트레이드오프 균형이 핵심 ### 정보주체의 권리 (개인정보보호법) - **열람권**: 본인 정보 열람 요구 - **정정·삭제권**: 잘못된 정보 수정·삭제 요청 - **처리정지권**: 정보 처리 중단 요청 - **자기결정권**: 본인 정보의 처리·활용에 대한 결정권 - **잊혀질 권리(Right to be Forgotten)**: GDPR 명문화 — 본인 정보의 삭제·소거 요청 - **이동권(Data Portability)**: 본인 정보를 다른 서비스로 이전 요청 ### 데이터 3법 (2020 개정) - **개인정보보호법**: 개인정보 처리·보호 원칙 — 가명정보 도입 - **정보통신망법**: 정보통신서비스 제공자의 개인정보 보호 - **신용정보법**: 신용정보의 활용·보호 — 마이데이터 근거법 ### 가명정보 활용 - **가명정보(Pseudonymous Data)**: 추가 정보 없이는 특정 개인 식별 불가 — 통계·연구·공익 목적 동의 없이 활용 가능 - **익명정보(Anonymous Data)**: 시간·비용·기술을 합리적으로 고려할 때 다른 정보와 결합해도 특정 개인 식별 불가 — 개인정보보호법 적용 제외 ### GDPR 7대 원칙 - **합법성·공정성·투명성(Lawfulness, Fairness, Transparency)** - **목적 적합성(Purpose Limitation)**: 수집 목적에 부합하는 처리만 — 다른 목적으로 재사용 제한 - **데이터 최소화(Data Minimization)**: 필요한 최소한의 데이터만 처리 - **정확성(Accuracy)**: 부정확한 데이터는 즉시 수정·삭제 - **저장 제한(Storage Limitation)**: 필요 기간만 보관 - **무결성·기밀성(Integrity, Confidentiality)**: 보안 조치 의무 - **책임성(Accountability)**: 처리자가 준수 입증 책임 ### 정보주체 추가 권리 (GDPR) - **처리 제한권(Right to Restriction)**: 처리를 일시 중단할 권리 - **자동화된 결정에 반대할 권리**: 프로파일링·자동 의사결정에 인간 개입 요청 ### 프라이버시 보존 컴퓨팅 (PPC) - **PPC(Privacy-Preserving Computation)**: 데이터를 노출하지 않고 분석·계산이 가능한 기술 총칭 - **MPC(Multi-Party Computation, 다자간 연산)**: 여러 참가자가 자기 데이터를 공개하지 않고 공동 계산 - **동형암호(Homomorphic Encryption)**: 암호화 상태에서 연산 — 결과만 복호화 - **차분 프라이버시(Differential Privacy)**: 잡음 추가로 개인 정보 영향 제한 - **연합학습(Federated Learning)**: 데이터를 모으지 않고 모델만 공유 ### 알고리즘 편향 (Algorithmic Bias) - **알고리즘 편향(Algorithmic Bias)**: 학습 데이터·설계의 편향이 AI 의사결정에 차별·과신·잘못된 추론으로 나타남 - 원인: 학습 데이터의 대표성 부족·역사적 차별 데이터·라벨링 편향 - 결과: 인종·성별 차별, 신용·채용·법원 판결에서의 불공정 - 완화: 공정성(Fairness) 평가 지표·균형 데이터·편향 감사 ### 빅데이터 3대 위기 요인 × 통제 방안 매핑 (완전판) | 위기 요인 | 통제 방안 | |----------|-----------| | ①사생활 침해(개인정보 노출·재식별) | **동의제(사전 동의) → 책임제(사후 책임)** 패러다임 전환 | | ②책임 원칙 훼손(잠재적 성향만으로 처벌·불이익) | **결과 기반 책임 원칙** (Outcome-based Accountability) | | ③데이터 오용(잘못된 추론·과신·차별) | **알고리즘 접근권·투명성 보장** (알고리즈미스트 역할) | ### 패러다임 전환 — 동의제 vs 책임제 - **동의제(Consent-based)**: 활용 시점마다 정보주체의 사전 동의 필요 - 한계: 빅데이터 시대에는 일일이 동의 받기 어려움 - **책임제(Accountability-based)**: 데이터 사용자가 사후 책임을 짐 - 데이터 오용 시 처벌·배상 가능 - GDPR의 책임성(Accountability) 원칙과 유사 - **사전 동의 → 사후 책임** 흐름이 핵심 ### 알고리즈미스트 (Algorithmist) - **알고리즈미스트(Algorithmist)**: 알고리즘의 적정성·공정성을 검증하고 피해자 입장에서 알고리즘을 평가하는 새로운 직업군 - **알고리즘 감시자·평가자 역할**: AI 책임성·투명성 확보 - 빅데이터·AI 시대의 윤리 가버넌스 핵심 인력 ### 재식별 사례 (Reidentification Cases) - **AOL 검색 로그 사례(2006)**: 사용자 65만 명의 검색 기록 공개 → 익명 ID로도 개인 식별 가능 증명 → 큰 사회적 파장 - **Netflix Prize 사례(2009)**: 익명화된 영화 평점 데이터에서 IMDB와 연결로 개인 식별 → 익명화의 한계 입증 - **시사점**: 단일 비식별 처리만으로는 결합 공격(linkage attack)을 막을 수 없음 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **가명화** — 식별자를 가명(코드)으로 대체 — 별도 매핑정보로 재식별 가능, GDPR이 인정하는 보호 기법 - **동형암호** — 암호화된 상태에서 연산이 가능한 암호 — 의료·금융 데이터 안전 분석에 활용 - **암호화** — 데이터를 키로 변환 — 키 없이는 복호화 불가 - **처리자(Processor) / 관리자(Controller)** — GDPR 용어 — 데이터를 위탁받아 처리 vs 처리 목적·방법 결정 - **재식별 위험** — 익명화된 데이터가 외부 데이터와 결합되어 개인을 다시 식별할 위험 - **DPIA** — GDPR의 영향평가 — 고위험 처리 시 의무 - **민감 정보** — 보호 대상 속성 — 질병·정치 성향·종교·성적 지향 - **Static Masking / Dynamic Masking** — 사전 일괄 마스킹 / 조회 시 실시간 마스킹 - **자동화된 결정에 반대할 권리** — 프로파일링·자동 의사결정에 인간 개입 요청 - **AOL 검색 로그 사례** — 사용자 65만 명의 검색 기록 공개 → 익명 ID로도 개인 식별 가능 증명 → 큰 사회적 파장 - **시사점** — 단일 비식별 처리만으로는 결합 공격(linkage attack)을 막을 수 없음 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 빅데이터 비즈니스 모델 URL: https://adsp.todaycode.kr/study/46 태그: 빅데이터, 빅데이터 활용, 분석 주제 유형, 데이터 기반 의사결정, IoT·플랫폼 ## 빅데이터 비즈니스 모델 정의 **빅데이터 비즈니스 모델**이란 빅데이터를 수집·분석·활용하여 수익을 창출하거나 기업 가치를 높이는 사업 방식입니다. ADsP 시험에서는 모델 유형 구분과 대표 사례 매핑이 핵심 출제 포인트입니다. ## 빅데이터 활용 수익 창출 유형 | 유형 | 설명 | 사례 | |------|------|------| | **데이터 판매 모델** | 보유 데이터를 직접 판매 또는 자산화 | 신용평가사 CB 데이터 판매 | | **광고 기반 모델** | 데이터 분석으로 타깃 광고 수익 창출 | **구글**, **페이스북(Meta)** | | **플랫폼 비즈니스 모델** | 네트워크 효과를 활용한 생태계 구축 | 카카오, 네이버 | | **빅데이터 서비스 제공 모델** | 분석 인프라·서비스를 판매 | **AWS**, **Google Cloud**, Azure | | **데이터 기반 의사결정 모델** | 내부 데이터 분석으로 비용 절감·최적화 | **넷플릭스 추천**, **아마존 물류 최적화** | ## 정보 판매 모델 (Information Selling) - 구글: 검색 행동 데이터 → **맞춤형 광고** 수익 - 페이스북: SNS 활동 데이터 → 타깃 마케팅 플랫폼 - 핵심: 사용자에게는 무료 서비스, 광고주에게 데이터 기반 광고 판매 ## 플랫폼 비즈니스 모델 - **네트워크 효과**: 이용자가 많을수록 플랫폼 가치 증가 - 양면 시장(Two-sided Market): 소비자와 공급자를 연결 - 데이터 축적 → 추천·맞춤화 → 이용자 증가의 선순환 구조 ## 빅데이터 3대 혁신 | 혁신 | 영문 | 내용 | |------|------|------| | **화폐화** | Monetization | 데이터를 수익으로 전환 | | **개인화** | Personalization | 개인별 맞춤 서비스 제공 | | **지능화** | Intelligence | AI·분석 기반 자동화·최적화 | > **시험 핵심**: 빅데이터 비즈니스 모델 유형(정보 판매, 플랫폼, 서비스 제공, 의사결정)과 대표 사례를 정확히 매핑하세요. 빅데이터 3대 혁신(화폐화·개인화·지능화)도 자주 출제됩니다. ### 미래의 빅데이터와 데이터 사이언스 URL: https://adsp.todaycode.kr/study/47 태그: 빅데이터, 데이터 사이언스, 개인정보, 빅데이터 가치, 데이터 거버넌스, 기술통계, 모형 평가, IoT·플랫폼 ## 빅데이터 미래 발전 방향 빅데이터는 단순 대용량 처리에서 벗어나 **초개인화**, **실시간 처리**, **AI 융합** 방향으로 발전하고 있습니다. | 트렌드 | 설명 | |--------|------| | **초개인화** | 개인 맥락·행동 패턴 기반 1:1 맞춤 서비스 | | **실시간 처리** | 스트리밍 데이터를 즉시 분석·대응 | | **AI 융합** | 머신러닝·딥러닝과 빅데이터 결합 | | **엣지 컴퓨팅** | 데이터 생성 지점(엣지)에서 처리, 지연 최소화 | | **5G·IoT 융합** | 초연결 환경에서 폭발적 데이터 증가 | | **디지털 트윈** | 현실 세계를 가상으로 복제하여 시뮬레이션 | ## 데이터 이코노미 (Data Economy) - **데이터 이코노미**: 데이터가 석유처럼 **경제적 자산으로 거래**되는 시대 - 데이터 브로커, 데이터 마켓플레이스 등장 - 개인 데이터 주권(Data Sovereignty) 논의 활성화 ## 데이터 자원의 경제적 특성 | 특성 | 설명 | |------|------| | **비경합성 (Non-rival)** | 한 사람이 사용해도 다른 사람의 사용이 줄지 않음 | | **비배제성** | 데이터 공유 시 제3자 배제가 어려움 | | **네트워크 효과** | 데이터가 많을수록 가치 증가 | | **규모의 경제** | 데이터 규모가 커질수록 분석 정확도 향상 | ## 데이터 사이언스의 미래 기술 - **AutoML**: 모델 선택·하이퍼파라미터 튜닝 자동화, 비전문가도 ML 활용 가능 - **설명 가능한 AI (XAI, eXplainable AI)**: 블랙박스 AI의 의사결정 과정을 인간이 이해할 수 있도록 설명 - **연합학습 (Federated Learning)**: 데이터를 중앙 서버에 모으지 않고 분산된 기기에서 모델 학습 → **개인정보 보호** 실현 ## 데이터 윤리와 AI 거버넌스 - **데이터 윤리**: 개인정보 보호, 알고리즘 편향 방지, 투명성 확보 - **AI 거버넌스**: AI 시스템의 책임·공정성·안전성을 관리하는 체계 - **GDPR(유럽 일반 데이터 보호 규정)**: 개인 데이터 처리에 관한 핵심 규제 사례 > **시험 핵심**: 데이터 자원의 **비경합성**(non-rival)은 일반 재화와 구별되는 핵심 특성입니다. 연합학습(Federated Learning)은 개인정보 보호를 위한 분산 학습 방식임을 기억하세요. ## 추가 핵심 개념 — MLOps와 모델 운영 - **MLOps(Machine Learning Operations)**: ML 모형의 개발·배포·모니터링·재학습을 자동화하는 방법론·도구. DevOps + ML. - **모델 드리프트(Model Drift)**: 배포된 모형의 성능이 시간 경과로 저하되는 현상. - **데이터 드리프트(Data Drift)**: 입력 분포 변화 - **컨셉 드리프트(Concept Drift)**: 입력-출력 관계 변화 - **라벨 드리프트(Label Drift)**: 라벨 분포 변화 - **A/B 테스트**: 서로 다른 모델/UI를 실제 사용자 집단에 동시에 적용해 성능을 통계적으로 비교. - **MLOps 도구**: MLflow, Kubeflow, AWS SageMaker, GCP Vertex AI, Tecton(피처 스토어), Evidently(드리프트 탐지). - **추천 시스템 — 내용 기반 vs 협업 필터링**: - **내용 기반(Content-Based)**: 아이템 속성·태그와 사용자 선호 프로필 매칭. 콜드스타트 사용자에 강함 - **협업 필터링(Collaborative Filtering)**: 비슷한 사용자/아이템의 행동 패턴 활용. SVD·NMF·딥러닝(NCF) - **하이브리드**: 두 방식 결합 - **강화학습(Reinforcement Learning)**: 에이전트가 환경과 상호작용하며 보상(Reward)을 최대화하는 정책(Policy) 학습. AlphaGo·자율주행·게임 AI. > **시험 핵심**: 모델 드리프트 3종, 추천 시스템의 콘텐츠 기반 vs 협업 필터링, 지도/비지도/강화학습 3분류가 미래 빅데이터 단원의 출제 포인트입니다. ### 데이터 윤리와 책임 - **데이터 윤리(Data Ethics)**: 수집·분석·활용 전반에서 개인의 권리·공정성·투명성·책임을 고려하는 원칙 - **책임 있는 AI(Responsible AI)**: 공정성·설명가능성·견고성·프라이버시·책임성을 충족하는 AI 개발 원칙 - **알고리즘 책무성(Accountability)**: 알고리즘 결정의 결과에 대한 설명과 책임 - **모델 거버넌스**: 학습 데이터·모델·예측 결과의 추적·감사·재현성 확보 ### 모델 운영(MLOps)과 갱신 - **모델 배포(Deployment)**: 학습된 모델을 운영 시스템에 통합 - **모니터링**: 정확도·지연·드리프트 감시 - **모델 갱신(Retraining)**: 데이터 분포 변화(Data Drift)·개념 변화(Concept Drift)에 대응해 주기적으로 재학습 ### 빅데이터 기술 아키텍처 - **Lambda 아키텍처**: 배치 + 실시간 계층 결합 - **Kappa 아키텍처**: 실시간 스트림 통합 처리 — 더 단순한 구조 - **In-memory 컴퓨팅**: 디스크 대신 메모리에 데이터를 보관해 빠른 처리 (Spark·Redis) ### 빅데이터 인프라 기술 트렌드 - **IoT(Internet of Things, 사물인터넷)**: 센서·디바이스가 인터넷으로 연결되어 데이터 생성·교환 - **클라우드 컴퓨팅(Cloud Computing)**: 인터넷 기반 자원 공유 — IaaS/PaaS/SaaS - **엣지 컴퓨팅(Edge Computing)**: 데이터 발생지 근처에서 처리 → 지연 시간·대역폭 절감 (자율주행·IoT) - **5G**: 초고속·초저지연·초연결 무선통신 — IoT·자율주행 가속 ### 4차 산업혁명 키워드 - **초연결(Hyperconnectivity)**: 인간-사물-데이터가 모두 연결 - **초지능(Superintelligence)**: AI가 인간 수준을 넘어서는 사고력 발휘 - **스마트(Smart) / 지능형(Intelligent)**: 기존 시스템에 AI·데이터 분석을 결합 ### 딥러닝 모델 트렌드 - **오토인코더(Autoencoder)**: 입력을 압축·복원하도록 학습 — 차원축소·이상 탐지·노이즈 제거 - **VAE(Variational Autoencoder)**: 잠재 공간을 확률 분포로 학습 — 생성 모델 - **GAN(Generative Adversarial Network)**: 생성자(Generator) + 판별자(Discriminator) — 이미지·텍스트 생성 - **Attention(어텐션)**: 시퀀스에서 중요 부분에 가중치를 집중하는 메커니즘 - **Transformer(트랜스포머)**: Attention만으로 구성된 모델 — RNN 없이 병렬 처리, NLP 표준 - **BERT / GPT**: Transformer 기반의 사전학습 언어 모델 ### 강화학습 (RL) - **Q-Learning**: 행동-가치 함수 Q(s, a)를 학습하는 모델프리 RL - **정책(Policy) / 가치 함수(Value Function)**: 상태 → 행동, 상태 → 기대 보상 - **보상(Reward) / 상태(State) / 행동(Action)**: RL의 3대 신호 - 활용: 게임 AI·로보틱스·자율주행·추천 시스템 ### AI 단계와 미래 - **약한 인공지능(Narrow AI)**: 특정 작업에 한정 (현재 대부분) - **강한 인공지능(General AI, AGI)**: 인간 수준의 범용 지능 - **특이점(Singularity)**: AI가 인간 지능을 넘어서는 가상의 시점 ### AutoML과 자동화 - **AutoML(Automated Machine Learning)**: 데이터 → 전처리 → 모델 선택 → 하이퍼파라미터 튜닝 → 평가의 ML 워크플로 자동화 - **NAS(Neural Architecture Search)**: 신경망 구조 자체를 자동 탐색 — 강화학습·진화 알고리즘·미분 가능 NAS - **AutoML 도구**: AutoKeras·TPOT·H2O.ai·DataRobot·Google AutoML·Azure AutoML - 의의: 비전문가도 ML 활용 가능, 전문가는 의사결정에 집중 ### 증강 분석 - **Augmented Analytics**: AI가 분석 과정을 자동화·증강 — 인사이트 자동 발견·자연어 질의 - **Conversational BI**: 챗봇 형태로 BI 질의 (예: ThoughtSpot·Tableau Ask Data) ### 컴퓨터 비전 대표 아키텍처 - **AlexNet(2012)**: ImageNet 우승, CNN의 부활을 알린 8층 신경망 - **VGGNet(2014)**: 3×3 작은 필터로 깊이를 확장한 16/19층 모델 - **GoogLeNet/Inception**: Inception 모듈로 다양한 크기 필터 병렬 결합 - **ResNet(2015)**: 잔차 연결(Skip Connection)로 100+ 층까지 학습 가능 — Vanishing Gradient 극복 - **EfficientNet(2019)**: 깊이·너비·해상도 균형 스케일링 - **객체 탐지**: YOLO(You Only Look Once)·R-CNN·Faster R-CNN·Mask R-CNN ### GAN 변형 - **DCGAN(Deep Convolutional GAN)**: GAN에 CNN 적용 — 안정적 이미지 생성 - **CycleGAN**: 짝지어진 데이터 없이 이미지-이미지 변환 (말↔얼룩말, 사진↔그림) - **StyleGAN**: 스타일 제어 가능한 고품질 얼굴 생성 ### 강화학습 알고리즘 - **Q-Learning**: 가치 기반 RL (Off-policy) - **DQN(Deep Q-Network)**: Q-Learning + 딥러닝 — Atari 게임 학습 (DeepMind 2013) - **A3C(Asynchronous Advantage Actor-Critic)**: 정책+가치 동시 학습 - **PPO(Proximal Policy Optimization)**: 안정적 정책 그래디언트 — OpenAI 표준 ### LLM·Vector DB 시대 - **Foundation Model / LLM(Large Language Model)**: GPT·Claude·Gemini·Llama 등 거대 언어 모델 - **Prompt Engineering(프롬프트 엔지니어링)**: 모델 출력을 유도하는 프롬프트 작성 기술 - **Fine-tuning(파인튜닝)**: 사전학습 모델을 특정 도메인에 맞게 추가 학습 - **RAG(Retrieval-Augmented Generation)**: 외부 지식 검색을 결합한 생성 — 환각(Hallucination) 완화 - **Chain-of-Thought(CoT) Prompting**: 단계적 사고 과정을 명시 → 추론 성능 향상 - **Vector DB**: Pinecone·Weaviate·Milvus·Chroma·Qdrant — 임베딩 벡터 검색에 특화 - **임베딩 검색(Semantic Search)**: 텍스트·이미지를 벡터로 변환 후 코사인 유사도 검색 - **AI Agents**: LangChain·AutoGPT 등 LLM을 도구로 활용해 자율 작업 ### 디지털 트윈 (Digital Twin) - **Digital Twin(디지털 트윈)**: 물리 세계의 객체·시스템을 디지털 공간에 실시간 복제한 모델 - 활용: 제조 공정 시뮬레이션·도시 운영·헬스케어·항공기 엔진 모니터링 - IoT 센서 + AI 분석 + 시뮬레이션의 결합 ### 역사적 AI 이정표 - **AlphaGo(알파고, 2016)**: DeepMind의 바둑 AI — 이세돌 9단을 4-1로 승리 - **AlphaZero(2017)**: 인간 기보 없이 self-play로 바둑·체스·쇼기 마스터 - **AlphaFold(2020)**: 단백질 구조 예측에서 인간 수준 달성 — 노벨화학상(2024) 수상 - **ChatGPT(2022)**: 대중에 LLM 시대 알림 — 5일 만에 1억 사용자 ### DeepMind와 OpenAI - **DeepMind(2010~)**: 영국 AI 연구소, 구글이 2014년 인수 - **OpenAI(2015~)**: 미국 AI 연구소, GPT 시리즈·ChatGPT·DALL-E 개발 - **Anthropic(2021~)**: Claude 시리즈 개발, AI 안전·정렬 연구 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **데이터 윤리** — 수집·분석·활용 전반에서 개인의 권리·공정성·투명성·책임을 고려하는 원칙 - **책임 있는 AI** — 공정성·설명가능성·견고성·프라이버시·책임성을 충족하는 AI 개발 원칙 - **알고리즘 책무성** — 알고리즘 결정의 결과에 대한 설명과 책임 - **모델 거버넌스** — 학습 데이터·모델·예측 결과의 추적·감사·재현성 확보 - **모델 갱신** — 데이터 분포 변화(Data Drift)·개념 변화(Concept Drift)에 대응해 주기적으로 재학습 - **Kappa 아키텍처** — 실시간 스트림 통합 처리 — 더 단순한 구조 - **In-memory 컴퓨팅** — 디스크 대신 메모리에 데이터를 보관해 빠른 처리 (Spark·Redis) - **클라우드 컴퓨팅** — 인터넷 기반 자원 공유 — IaaS/PaaS/SaaS - **초지능** — AI가 인간 수준을 넘어서는 사고력 발휘 - **스마트(Smart) / 지능형(Intelligent)** — 기존 시스템에 AI·데이터 분석을 결합 - **Attention** — 시퀀스에서 중요 부분에 가중치를 집중하는 메커니즘 - **BERT / GPT** — Transformer 기반의 사전학습 언어 모델 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. --- ## 2과목 데이터 분석 기획 ### 분석 기획의 개념과 고려사항 URL: https://adsp.todaycode.kr/study/13 태그: 빅데이터 활용, 분석 기획, 분석 주제 유형, 분석 방법론, 우선순위 평가, 분석 성숙도, 데이터 거버넌스, IoT·플랫폼, 데이터 품질 분석 기획이란 데이터 분석을 수행하기에 앞서 무엇을 분석할 것인지(과제 정의), 어떻게 관리할 것인지(관리 방안)를 사전에 계획하는 작업입니다. 성공적인 분석 프로젝트를 위해서는 기술적 역량뿐만 아니라 균형 잡힌 시각이 필요합니다. 분석 기획 시 반드시 고려해야 할 세 가지 사항이 있습니다. 첫째, 가용한 데이터입니다. 분석에 필요한 데이터를 확보할 수 있는지, 그 데이터가 정형인지 반정형인지 비정형인지를 사전에 파악해야 합니다. 데이터가 없다면 아무리 좋은 분석 기법도 쓸모가 없기 때문입니다. 둘째, 적절한 유스케이스입니다. 처음부터 모든 것을 새로 만들기보다는 기존에 수립된 유사한 분석 시나리오나 솔루션을 최대한 활용하는 것이 효율적입니다. 셋째, 장애요소 확인입니다. 분석을 방해할 수 있는 요소들(데이터 부족, 기술 한계, 조직 저항 등)을 미리 파악하고 대응 계획을 수립해야 합니다. 시험에서 "고려사항이 아닌 것"을 묻는 문제가 자주 출제됩니다. "최신 분석 기법으로 분석을 진행한다"는 고려사항이 아닙니다. 분석 기획은 최신 기법을 쓰는 것이 목적이 아니라, 적절한 기법으로 문제를 해결하는 것이 목적이기 때문입니다. 또한 "데이터 정합성 검증"은 기획 단계가 아닌 데이터 준비 단계에서 수행하는 작업이므로, 분석 기획의 고려사항에 포함되지 않습니다. --- --- ## 핵심 요약 & 시험 포인트 | 고려사항 | 내용 | |----------|------| | **가용한 데이터** | 데이터 확보 및 유형 분석 사전 시행 (정형/반정형/비정형) | | **적절한 유스케이스** | 기존 유사 분석 시나리오·솔루션 최대한 활용 | | **장애요소 확인** | 분석 방해 요소에 대한 사전 계획 수립 | > 시험 포인트: "최신 분석 기법으로 분석 진행"은 고려사항이 아닙니다 (45회 출제). "데이터 정합성 검증"도 기획 단계가 아닌 데이터 준비 단계입니다. --- --- ## 분석 기획 4가지 주요 영역 (Domain) | 영역 | 내용 | 점검 항목 | |------|------|----------| | **데이터(Data)** | 분석에 활용 가능한 데이터 식별 | 가용성, 품질, 거버넌스 | | **시스템(System)** | 분석을 위한 IT 인프라·도구 | 컴퓨팅 자원, 분석 플랫폼 | | **인력(Manpower)** | 분석가·도메인 전문가 역량 | 조직 구조, 스킬셋, 외부 협력 | | **제도(Method/Procedure)** | 정책·프로세스·거버넌스 | 데이터 정책, 보안, 품질 관리 | ### 분석 기획 시 유의사항 1. **분석 결과 활용 방안 우선 정의** - "무엇을 알고 싶은가?"보다 "분석 결과를 어떻게 사용할 것인가?"가 먼저 - 액션이 없는 분석은 가치 없음 2. **데이터 가용성·품질 확인** - 필요한 데이터가 있는가? 품질이 충분한가? - 외부 데이터 구매 필요성 검토 3. **분석 결과의 비즈니스 가치 정량화** - 매출 증가, 비용 절감, 리스크 감소 등 KPI 연결 - ROI(투자 수익률) 추정 4. **변화 관리(Change Management)** - 새로운 분석 결과를 받아들이는 조직의 준비도 - 의사결정 프로세스 변경의 영향 - 직원 교육·소통 계획 ### 분석 기획 단계 - **요구사항 정의** → **데이터 정의** → **방법론 결정** → **성공 기준 설정** → **이행 계획** > **시험 포인트**: 분석 기획 4영역(데이터·시스템·인력·제도). "분석 결과의 활용 방안"을 먼저 정의하는 것이 핵심. ### 분석 기획의 본질적 질문 - **Why**: 왜 이 분석을 하는가 (목적·비즈니스 가치) - **What**: 무엇을 분석할 것인가 (대상·범위) - **How**: 어떻게 분석할 것인가 (방법·도구·인력) - **So-What(정성 성과)**: 분석 결과가 의사결정·행동에 어떤 의미를 주는가 — 결과를 통찰로 전환 ### 분석 시작점 명확화 - **해결할 문제 명확화(Why)**: 모호한 "데이터로 뭐 할 수 있을까?"가 아닌 구체적 문제로 정의 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **So-What** — 분석 결과가 의사결정·행동에 어떤 의미를 주는가 — 결과를 통찰로 전환 - **해결할 문제 명확화** — 모호한 "데이터로 뭐 할 수 있을까?"가 아닌 구체적 문제로 정의 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 분석 주제 유형 4가지 URL: https://adsp.todaycode.kr/study/14 태그: 분석 주제 유형 분석 주제 유형은 "분석 대상(What)을 아는가?"와 "분석 방법(How)을 아는가?"라는 두 축으로 구분되는 2×2 매트릭스입니다. 이 개념은 44~47회 모든 회차에서 출제된 최빈출 주제입니다. 분석 대상도 알고 분석 방법도 아는 경우는 **최적화(Optimization)**입니다. 이미 무엇을 분석해야 하는지도 알고 어떻게 분석해야 하는지도 아는 상태이므로, 기존 방법을 더욱 정교하게 다듬어 최적의 결과를 얻는 데 집중합니다. 분석 대상은 알지만 분석 방법을 모르는 경우는 **솔루션(Solution)**입니다. 무엇이 문제인지는 파악했지만 어떻게 해결할지 모르는 상태이므로, 적절한 분석 방법을 찾는 것이 과제입니다. 분석 대상은 모르지만 분석 방법은 아는 경우는 **통찰(Insight)**입니다. 분석 기법은 보유하고 있으나 그것을 어디에 적용할지 모르는 상태이므로, 분석 대상을 발굴하는 것이 핵심입니다. 분석 대상도 모르고 분석 방법도 모르는 경우는 **발견(Discovery)**입니다. 무엇을 어떻게 해야 할지 모두 불분명한 상태이므로, 탐색적 접근을 통해 새로운 패턴이나 인사이트를 발견하는 것이 목표입니다. --- --- ## 핵심 요약 & 시험 포인트 | | 분석 대상 **Known** | 분석 대상 **Un-Known** | |---|---|---| | **분석 방법 Known** | **최적화** (Optimization) | **통찰** (Insight) | | **분석 방법 Un-Known** | **솔루션** (Solution) | **발견** (Discovery) | > **시험 포인트:** 이 2×2 매트릭스는 44~47회 **매회 출제**되는 핵심 주제입니다. > - 대상 Known + 방법 Unknown = **솔루션** (47회 출제) > - 대상 Unknown + 방법 Known = **통찰** (45회 출제) > - 대상 Known + 방법 Known = **최적화** (46회 출제) --- ### 분석 과제 도출 — 하향식과 상향식 접근법 URL: https://adsp.todaycode.kr/study/15 태그: 분석 주제 유형, 하향식·상향식 접근, 비즈니스 모델 캔버스, 강화학습·지도학습 분석 과제를 도출하는 방법은 크게 **하향식(Top-Down)**과 **상향식(Bottom-Up)** 두 가지가 있습니다. 하향식 접근법은 해결해야 할 문제가 명확한 경우에 사용합니다. 체계적으로 단계를 나누어 문제를 해결하며, 분석 주제 유형 중 '최적화'와 '솔루션'에 해당할 때 적합합니다. 진행 순서는 **문제 탐색→문제 정의→해결 방안 탐색→타당성 검토**입니다. 문제 탐색 단계에서는 비즈니스 모델 기반 탐색(비즈니스 모델 캔버스의 9가지 블록을 5가지로 단순화하여 활용), 외부 참조 모델 기반 탐색(다른 기업의 성공 사례를 벤치마킹), 분석 유즈케이스(비즈니스 문제를 데이터 분석 문제로 전환)의 세 가지 기법을 사용합니다. "데이터 기반 탐색"은 하향식이 아닌 상향식 접근법의 특징이므로 주의해야 합니다. 상향식 접근법은 문제가 불분명한 경우에 사용합니다. 데이터를 먼저 탐색하여 인사이트와 지식을 얻는 Bottom-Up 방식이며, 분석 주제 유형 중 '통찰'과 '발견'에 해당합니다. **프로토타이핑 접근법**을 통해 빠르게 시제품을 만들고 반복적으로 개선해나가는 것이 특징입니다. **비지도학습**과 유사한 탐색적 분석 방식을 사용합니다. 시험에서 "문제가 명확히 정의되어 있는 경우 답을 찾는 기법"이라는 보기가 나오면 이것은 하향식 접근법의 설명이므로, 상향식과 혼동하지 않아야 합니다. --- --- ## 추가 핵심 개념 — 디자인 사고와 비즈니스 모델 캔버스 - **디자인 사고(Design Thinking)**: 상향식(발산: 다양한 아이디어 탐색)과 하향식(수렴: 분석·검증)을 반복해 창의적 해결책을 도출하는 사용자 중심 방법론. 스탠퍼드 d.school·IDEO에서 정형화한 5단계. - ① 공감(Empathize) — 사용자 관찰·인터뷰 - ② 정의(Define) — 문제 재정의 - ③ 발상(Ideate) — 아이디어 발산 - ④ 프로토타입(Prototype) — 빠른 시제품 제작 - ⑤ 테스트(Test) — 검증·반복 - **BMC(Business Model Canvas, 비즈니스 모델 캔버스)**: 9개 블록(가치 제안·고객 세그먼트·채널·고객 관계·수익 흐름·핵심 자원·핵심 활동·핵심 파트너·비용 구조)을 분석 과제 발굴 관점에서 **5대 영역**으로 단순화: - ① 업무(Operation), ② 제품/서비스(Product), ③ 고객(Customer), ④ 규제와 감사(Regulation & Audit), ⑤ 지원 인프라(Support Infrastructure) - **Quick-Win 전략**: 시급성↑·난이도↓ 사분면의 과제를 1순위로 수행하여 빠른 가치 입증·내부 신뢰 확보. > **시험 핵심**: 디자인 사고의 5단계 순서와 BMC 5대 분석 영역은 자주 출제됩니다. ### 디자인 사고 (Design Thinking) - 빅데이터 분석에서는 하향식(Top-down)·상향식(Bottom-up)을 디자인 사고의 **발산(Divergent) - 수렴(Convergent)** 사이클로 결합 - **발산**: 가능한 한 많은 아이디어·가설·과제 후보를 도출 (브레인스토밍·페인포인트 식별) - **수렴**: 평가 기준으로 우선순위·실행 과제 선택 - **공감 → 정의 → 아이디어 → 프로토타입 → 테스트**의 5단계 반복 ### 과제 발굴 용어 - **Quick Win(퀵윈)**: 단기에 빠르게 가시적 성과를 낼 수 있는 과제 — 초기 신뢰 확보 - **Pain Point(페인 포인트)**: 사용자/업무가 겪는 구체적 불편·문제 - **Use Case(유스케이스)**: 비즈니스 가치를 만들어내는 구체적 활용 시나리오 - **분석 기회 발굴**: 페인포인트·외부 사례·벤치마킹으로 분석 가치를 만들 영역 식별 - **What-if 분석**: "만약 ~라면?"의 시나리오 분석 — 처방 분석의 일부 ### 표기 변형 (공백 포함/제외) - **디자인사고 / 디자인 사고(Design Thinking)**: 둘 다 통용되는 표기 - **하향식접근법 / 하향식 접근법(Top-down Approach)**: 문제 정의 → 가설 → 데이터 → 검증 - **상향식접근법 / 상향식 접근법(Bottom-up Approach)**: 데이터 탐색 → 패턴 발견 → 인사이트 - ADsP 시험에서는 공백 없는 형태로도 자주 출제됨 ### 발산-수렴 사고의 단계 구분 - **공감하기(Empathize)**: 사용자 페인 포인트 이해 - **정의하기(Define)**: 핵심 문제 정의 - **아이디어 도출(Ideate)**: 발산적 사고로 다양한 아이디어 - **프로토타입(Prototype)**: 빠른 시제품 - **테스트(Test)**: 사용자 검증·반복 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **Quick Win** — 단기에 빠르게 가시적 성과를 낼 수 있는 과제 — 초기 신뢰 확보 - **Pain Point** — 사용자/업무가 겪는 구체적 불편·문제 - **Use Case** — 비즈니스 가치를 만들어내는 구체적 활용 시나리오 - **분석 기회 발굴** — 페인포인트·외부 사례·벤치마킹으로 분석 가치를 만들 영역 식별 - **What-if 분석** — "만약 ~라면?"의 시나리오 분석 — 처방 분석의 일부 - **하향식접근법 / 하향식 접근법** — 문제 정의 → 가설 → 데이터 → 검증 - **상향식접근법 / 상향식 접근법** — 데이터 탐색 → 패턴 발견 → 인사이트 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 분석 방법론 — 폭포수·나선형·프로토타입·KDD·CRISP-DM URL: https://adsp.todaycode.kr/study/16 태그: 데이터베이스, 분석 주제 유형, 하향식·상향식 접근, 분석 방법론, KDD, CRISP-DM, SEMMA, 폭포수 모델, 나선형 모델, 프로토타입, 기술통계, 표본추출, 군집분석, 차원 축소, 데이터 전처리, 데이터 마이닝, 데이터 마트, 이상치·결측, MLOps·최신 ML 분석 방법론은 데이터 분석 프로젝트를 체계적으로 수행하기 위한 절차와 방법을 정한 것입니다. **폭포수(Waterfall) 모형**은 가장 고전적이고 전통적인 개발 모형으로, 요구분석→설계→구현→테스트→유지보수를 한 방향으로 순차적으로 진행합니다. 각 단계가 완료된 후 다음 단계로 넘어가며, 문제가 발생하면 이전 단계로 피드백하여 수정합니다. **나선형(Spiral) 모형**은 계획 수립→위험 분석→개발 및 검증→고객 평가의 네 단계를 반복하며 점진적으로 시스템을 완성하는 방법입니다. 위험 분석을 중요시하며 유지보수가 필요 없다는 장점이 있지만, 효과적인 관리 체계가 없으면 복잡도가 급격히 상승할 수 있습니다. **프로토타입(Prototype) 모형**은 사용자의 요구사항이 불분명할 때 먼저 시제품을 만들어 결과를 예측하고, 그 결과를 바탕으로 반복적으로 개선하는 상향식 접근법입니다. **KDD(Knowledge Discovery in Database)**는 데이터베이스에서 유용한 지식을 발견하는 과정으로, 데이터셋 선택→데이터 전처리(노이즈, 이상값, 결측치 제거)→데이터 변환(차원 축소)→데이터마이닝→해석 및 평가의 순서로 진행됩니다. **CRISP-DM(Cross Industry Standard Process for Data Mining)**은 산업 표준 데이터마이닝 방법론으로, **업무 이해→데이터 이해→데이터 준비→모델링→평가→전개**의 6단계로 구성됩니다. 시험에서는 첫 번째 단계가 반드시 "업무 이해"라는 점을 기억해야 하며, "데이터 이해"나 "데이터 준비"가 먼저 오는 보기는 틀립니다. CRISP-DM은 **순환적(Iterative)** 구조로, 전개(Deployment) 단계 이후에도 새로운 비즈니스 요구나 데이터 변화에 따라 다시 업무 이해 단계로 되돌아가 반복 개선할 수 있습니다. **SEMMA(Sample→Explore→Modify→Model→Assess)**는 SAS Institute에서 개발한 데이터마이닝 방법론으로, 5단계로 구성됩니다. **Sample(표본추출)**은 분석 가능한 크기의 데이터 표본을 추출하는 단계입니다. **Explore(탐색)**은 시각화와 기술통계로 데이터의 특성과 이상값을 파악하는 단계입니다. **Modify(수정)**은 변수 변환, 결측치 처리, 파생 변수 생성 등 데이터를 정제하는 단계입니다. **Model(모델링)**은 예측·분류 모델을 구축하는 단계입니다. **Assess(평가)**는 모델 성능을 평가하고 검증하는 단계입니다. SEMMA는 SAS 분석 도구에 특화된 방법론으로, KDD·CRISP-DM과 함께 3대 데이터마이닝 방법론으로 시험에 출제됩니다. --- --- ## 핵심 요약 & 시험 포인트 ### 데이터마이닝 3대 방법론 비교 | 방법론 | 개발 | 단계 | |--------|------|------| | **KDD** | 학술 분야 | 선택→전처리→변환→마이닝→해석/평가 (5단계) | | **CRISP-DM** | 산업 표준 | 업무이해→데이터이해→데이터준비→모델링→평가→전개 (6단계) | | **SEMMA** | SAS Institute | Sample→Explore→Modify→Model→Assess (5단계) | > **시험 포인트:** CRISP-DM 첫 번째 단계는 반드시 **"업무 이해"** 입니다. KDD는 **"데이터셋 선택"**으로 시작합니다. SEMMA는 **"표본추출(Sample)"**로 시작합니다. > **추가 포인트:** CRISP-DM은 6단계가 **순환적(Iterative)**으로 운영됩니다. 전개 후에도 업무 이해 단계로 되돌아갈 수 있습니다 — 이 점이 KDD(선형 절차)와의 차이점입니다. --- ### 분석 방법론의 구성 - **방법론의 구성**: 단계(Phase) > 태스크(Task) > 스텝(Step) 계층 구조 - **단계별 산출물**: 각 단계 종료 시 산출되는 문서·모델·결정 사항 - **반복적 모형(Iterative)**: 단계를 반복하며 점진적으로 완성 — 애자일과 유사 ### Box-Jenkins 절차 (ARIMA 모형 구축) - **Box-Jenkins**: ARIMA 모형 식별·추정·진단의 반복 절차 - **모형 식별(Identification)**: ACF·PACF로 (p, d, q) 결정 - **모형 추정(Estimation)**: MLE로 계수 추정 - **모형 진단(Diagnostic)**: 잔차의 백색잡음 여부 확인 — Ljung-Box·Phillips-Perron ### 린 스타트업 (Lean Startup) - **린 스타트업(Lean Startup)**: 에릭 리스(Eric Ries)가 제안한 빠른 검증·반복의 스타트업 방법론 - 핵심 사이클: **Build → Measure → Learn(구축 → 측정 → 학습)** 반복 - **MVP(Minimum Viable Product, 최소 기능 제품)**: 핵심 기능만 갖춘 시제품으로 빠른 시장 검증 - **검증된 학습(Validated Learning)**: 가설을 데이터로 검증하며 학습 - **피봇(Pivot)**: 학습 결과 가설이 틀렸다면 방향 전환 - 빅데이터 분석 프로젝트에도 자주 적용 — PoC → MVP → 본격 배포 순서 ### 애자일 vs 린 비교 - **애자일**: 작은 사이클로 반복적 개발 (SW 개발 중심) - **린**: 가설-검증 사이클로 학습 가속 (제품·비즈니스 모델 검증 중심) - 두 방법론은 서로 보완적 — 자주 결합되어 사용 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **방법론의 구성** — 단계(Phase) > 태스크(Task) > 스텝(Step) 계층 구조 - **단계별 산출물** — 각 단계 종료 시 산출되는 문서·모델·결정 사항 - **반복적 모형** — 단계를 반복하며 점진적으로 완성 — 애자일과 유사 - **Box-Jenkins** — ARIMA 모형 식별·추정·진단의 반복 절차 - **모형 진단** — 잔차의 백색잡음 여부 확인 — Ljung-Box·Phillips-Perron - **린 스타트업** — 에릭 리스(Eric Ries)가 제안한 빠른 검증·반복의 스타트업 방법론 - **MVP** — 핵심 기능만 갖춘 시제품으로 빠른 시장 검증 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터 분석 방법론과 프로세스 URL: https://adsp.todaycode.kr/study/17 태그: 분석 기획, 분석 방법론, 분석 프로젝트 관리, 탐색적 분석, 데이터 마트, MLOps·최신 ML, 데이터 수집 데이터 분석 방법론은 단계(Phase), 태스크(Task), 스텝(Step)의 세 개 계층으로 구성됩니다. 전체 프로세스는 분석 기획→데이터 준비→데이터 분석→시스템 구현→평가 및 전개의 5단계로 진행됩니다. 분석 기획 단계에서는 비즈니스를 이해하고 분석의 범위를 설정하며, 프로젝트를 정의하고 위험(Risk) 대응 계획을 수립합니다. 이때 SOW(Statement of Work, 작업기술서)를 통해 고객의 요구사항과 예상 결과를 세부적으로 기술하고, WBS(Work Breakdown Structure, 업무분업구조도)를 통해 전체 업무를 분류하여 각 담당자에게 업무를 분할합니다. 위험 대응 방안으로는 회피(위험 자체를 제거), 전이(보험 등으로 책임 이전), 완화(위험 영향을 축소), 수용(위험을 인정하고 감수)의 네 가지가 있습니다. 데이터 준비 단계에서는 필요한 데이터를 정의하고 수집하며, 데이터의 정합성을 점검합니다. 데이터 수집 방법으로는 웹 크롤링(웹 데이터 자동 수집), API(프로그램 간 데이터 교환 규칙), ETL(Extract-Transform-Load, 데이터 추출→변환→적재)이 있습니다. 데이터 분석 단계에서는 탐색적 데이터 분석(EDA)을 통해 데이터의 특성을 파악하고, 데이터를 훈련용 학습 데이터와 검증용 실험 데이터로 분할한 후 모델링과 검증을 수행합니다. 시스템 구현 단계에서는 분석 결과를 실제 시스템으로 설계하고 구현하며, 단순한 분석 프로젝트의 경우 이 단계를 생략할 수 있습니다. 마지막으로 평가 및 전개 단계에서는 모델의 발전 계획을 수립하고 프로젝트를 평가 및 보고하며, 지속적인 교육과 활용을 통해 조직의 분석 역량을 내재화합니다. --- --- ## 핵심 요약 & 시험 포인트 **단계(Phase) → 태스크(Task) → 스텝(Step)** 의 3개 층으로 구성됩니다. | 단계 | 핵심 내용 | 주요 용어 | |------|-----------|-----------| | **분석 기획** | 비즈니스 이해, 범위 설정, 프로젝트 정의, 위험 계획 | SOW(작업기술서), WBS(업무분업구조도) | | **데이터 준비** | 데이터 정의, 수집, 정합성 점검 | 웹 크롤링, API, ETL | | **데이터 분석** | 탐색적 분석, 모델링, 평가/검증 | EDA, 훈련/검증 데이터 분할 | | **시스템 구현** | 설계, 구현, 테스트, 운영 | 단순 분석 프로젝트는 이 단계 생략 가능 | | **평가 및 전개** | 모델 발전 계획, 프로젝트 평가/보고 | 조직 역량 내재화 | > **시험 포인트:** 분석 프로세스 순서는 **분석 기획→데이터 준비→데이터 분석→시스템 구현→평가 및 전개** (44회 출제). 위험 대응 방안은 **회피, 전이, 완화, 수용** 4가지입니다. --- --- ## 추가 핵심 개념 — 프로젝트 관리 도구 - **PMBOK(Project Management Body of Knowledge)**: PMI가 발간하는 프로젝트 관리 표준 지식체계. 5대 프로세스 그룹(착수·계획·실행·통제·종료)과 10대 지식 영역(범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자·통합). - **WBS(Work Breakdown Structure, 작업분류체계)**: 프로젝트 전체 범위를 관리 가능한 소규모 작업(Work Package)으로 계층적으로 분해한 구조(100% 규칙). - **간트차트(Gantt Chart)**: 작업 일정을 시간 축에 막대로 시각화한 도구. 작업 시작·종료·기간 한눈에 파악. - **CPM(Critical Path Method, 임계 경로법)**: 작업 간 선후 의존을 분석해 프로젝트 완료에 필요한 최단 경로(임계 경로)를 찾는 일정 관리 기법. - **PERT(Program Evaluation Review Technique)**: 불확실한 작업 시간을 낙관·비관·최빈으로 3점 추정하여 일정 분포를 산출. - **애자일(Agile) / 스크럼(Scrum)**: 2~4주 단위 스프린트(Sprint)로 반복적·점진적 개발. 일일 스탠드업·백로그·번다운 차트 활용. 변화 대응에 강점. > **시험 핵심**: PMBOK 10대 영역과 WBS·간트·CPM·PERT의 차이가 프로젝트 관리 단원의 핵심입니다. ### 검증·실행 단계 용어 - **PoC(Proof of Concept)**: 개념 증명 — 핵심 아이디어가 실제로 동작하는지 소규모로 검증 - **파일럿(Pilot)**: 일부 사용자·일부 지역 등 제한 범위에서 운영 환경에 가깝게 시험 운영 - **MVP(Minimum Viable Product)**: 최소 기능만 갖춘 제품으로 시장 반응 확인 - **PoC → Pilot → 본 시스템**의 단계적 확산이 일반적 ### 애자일 분석 프로세스 - **애자일(Agile)**: 짧은 주기로 반복·개선하며 변화에 빠르게 대응 - **스크럼(Scrum)**: Sprint·Daily Standup·Retrospective 등 의례화된 애자일 프레임워크 - **칸반(Kanban)**: 시각화 보드에 작업을 카드로 표현, WIP(Work In Progress) 제한으로 흐름 최적화 - **RACI 매트릭스**: Responsible·Accountable·Consulted·Informed — 분석 과제 책임 분담 도구 ### 방법론의 계층 구조 - **단계(Phase)**: 가장 큰 작업 묶음 (예: 분석 기획, 모델링) - **태스크(Task)**: 단계 내 의미 있는 작업 단위 - **스텝(Step)**: 태스크를 구성하는 세부 작업 — 가장 작은 실행 단위 - 각 단계 종료 시 **산출물(Deliverables)** 정의 — 다음 단계 입력으로 사용 ### 폭포수·나선형·프로토타입 비교 (요약) - **폭포수(Waterfall)**: 순차적·반복 없음 — 요구가 명확할 때 - **나선형(Spiral)**: 반복하며 리스크 줄여나감 — 대규모·고위험 - **프로토타입(Prototype)**: 모형으로 빠르게 검증 - **반복적(Iterative)**: 작은 사이클을 반복하며 점진적 완성 — 애자일의 기초 ### 애자일 (Agile) - **애자일 선언문(Agile Manifesto, 2001)**: 17명의 SW 전문가가 발표한 애자일 4대 가치 1. 프로세스·도구보다 **개인과 상호작용** 2. 포괄적 문서보다 **작동하는 소프트웨어** 3. 계약 협상보다 **고객과의 협력** 4. 계획 준수보다 **변화에 대응** - 12원칙으로 구체화 — 짧은 주기·고객 협력·반복적 개선 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **PoC** — 개념 증명 — 핵심 아이디어가 실제로 동작하는지 소규모로 검증 - **파일럿** — 일부 사용자·일부 지역 등 제한 범위에서 운영 환경에 가깝게 시험 운영 - **MVP** — 최소 기능만 갖춘 제품으로 시장 반응 확인 - **스크럼** — Sprint·Daily Standup·Retrospective 등 의례화된 애자일 프레임워크 - **RACI 매트릭스** — Responsible·Accountable·Consulted·Informed — 분석 과제 책임 분담 도구 - **애자일 선언문** — 17명의 SW 전문가가 발표한 애자일 4대 가치 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 분석 프로젝트와 과제 정의서 URL: https://adsp.todaycode.kr/study/18 태그: 분석 과제 정의서, 우선순위 평가, 분석 프로젝트 관리, 모형 평가, 분류 임계값 분석 프로젝트는 비즈니스 영역과 데이터 영역의 현황을 파악하고 구성원과 협업하여 진행합니다. 주로 애자일(Agile) 방식으로 관리하며, 분석 과제 정의서를 기반으로 프로젝트를 수행합니다. 분석 과제 정의서에는 분석에 필요한 소스 데이터, 분석 방법, 데이터 입수 및 분석 난이도, 분석 수행 주기, 분석 결과에 대한 검증 방법 등이 포함됩니다. 이해관계자들이 프로젝트의 방향을 설정하고 성공 여부를 판단하기 위한 명확한 기준을 제공하는 문서입니다. 시험에서 "활용 데이터는 내부 데이터로만 제한해야 한다"는 보기가 나오면 틀린 것입니다. 외부 데이터도 필요에 따라 활용할 수 있습니다. 분석 과제의 주요 특징 5가지는 데이터 크기(Data Size), 데이터 복잡성(Data Complexity), 속도(Speed), 분석 복잡성(Analytic Complexity), 정확도와 정밀도(Accuracy & Precision)입니다. 정확도는 모델의 예측값과 실제값의 차이가 작을수록 높은 것이고, 정밀도는 같은 분석을 반복했을 때 결과의 편차가 작을수록 높은 것입니다. 정확도와 정밀도 사이에는 트레이드오프(Trade-off) 관계가 존재하여, 정확도를 높이면 분석 복잡도가 상승할 수 있습니다. --- --- ## 핵심 요약 & 시험 포인트 ### 분석 과제 주요 특징 5가지 1. **Data Size** (데이터 크기) 2. **Data Complexity** (데이터 복잡성) 3. **Speed** (속도) 4. **Analytic Complexity** (분석 복잡성) 5. **Accuracy & Precision** (정확도 & 정밀도) | 개념 | 정의 | 관점 | |------|------|------| | **정확도 (Accuracy)** | 모델 예측과 실제값의 차이가 적을수록 높음 | 분석의 **활용** 측면 | | **정밀도 (Precision)** | 반복 예측 시 결과 편차가 적을수록 높음 | 분석의 **안정성** 측면 | > **시험 포인트:** 정확도와 정밀도 사이에는 **Trade-off** 관계가 존재합니다. 정확도↑ → 복잡도↑ (46회 출제). ### 분석 프로젝트 관리 방안 10가지 시간, 범위, 품질, 통합, 이해관계자, 자원, 원가, 리스크, 조달, 의사소통 --- ### 프로젝트 관리 표준 - **WBS(Work Breakdown Structure)**: 작업을 단계적으로 분해해 관리 가능한 작업 패키지로 만든 계층 구조 - **PMBOK(Project Management Body of Knowledge)**: PMI가 정의한 프로젝트 관리 표준 - **PMBOK 10대 지식 영역**: 통합·범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자 관리 - **범위 관리(Scope Management)**: 프로젝트에 포함/제외할 작업 정의·통제 - **일정 관리(Schedule Management)**: WBS·간트차트·CPM(임계경로법) - **리스크 관리**: 식별 → 분석 → 대응 계획 → 모니터링 ### 위험 관리 - **위험 관리(Risk Management)** 4단계: 식별(Identification) → 분석(Analysis) → 대응(Response) → 모니터링(Monitoring) - **대응 전략**: 회피·완화·이전(보험)·수용 - **리스크 매트릭스**: 발생 가능성 × 영향도 — 우선순위 결정 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **WBS** — 작업을 단계적으로 분해해 관리 가능한 작업 패키지로 만든 계층 구조 - **PMBOK 10대 지식 영역** — 통합·범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자 관리 - **범위 관리** — 프로젝트에 포함/제외할 작업 정의·통제 - **리스크 관리** — 식별 → 분석 → 대응 계획 → 모니터링 - **위험 관리** — 4단계: 식별(Identification) → 분석(Analysis) → 대응(Response) → 모니터링(Monitorin… - **리스크 매트릭스** — 발생 가능성 × 영향도 — 우선순위 결정 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 분석 마스터플랜과 우선순위 평가 URL: https://adsp.todaycode.kr/study/19 태그: 빅데이터 3V/5V, 하향식·상향식 접근, 분석 마스터플랜, 우선순위 평가, 변수 선택, 분석 로드맵 분석 마스터플랜은 데이터 분석 과제를 전사적 관점에서 체계적으로 수행하기 위한 중장기 계획입니다. 수립 절차는 분석 과제 도출→과제 우선순위 결정→적용 우선순위 결정→분석 구현 로드맵 수립 순서로 진행됩니다. 로드맵이란 목표 달성을 위한 방향과 일정을 시각적으로 표현한 문서입니다. 우선순위 평가 기준은 시급성과 난이도라는 두 축으로 구성됩니다. 시급성은 전략적 중요도와 비즈니스 효과(Return)를 기준으로 판단하며, 현재 시급한 과제일수록 높은 순위를 받습니다. 난이도는 데이터 획득·저장·가공 비용과 분석 적용 비용 등의 투자 비용(Investment)을 기준으로 판단합니다. 이 두 축으로 과제를 4개 영역으로 나누면, 난이도가 낮고 시급성이 높은 과제(Quick-Win)가 항상 최우선 순위입니다. 이 과제들은 적은 투자로 빠른 효과를 얻을 수 있기 때문입니다. 시급성을 우선하는 경우와 난이도를 우선하는 경우에 따라 2~3순위가 달라지지만, 최우선 과제는 항상 동일합니다. 또한 난이도가 높지만 시급성도 높은 과제는 경영진의 의사결정에 따라 우선순위가 조정될 수 있습니다. ISP(Information Strategy Planning, 정보전략계획)는 전략적 주요 정보를 대상으로 전사적인 종합 추진 계획을 수립하는 것으로, 중장기 마스터플랜 수립과 관련됩니다. --- --- ## 핵심 요약 & 시험 포인트 ### 수립 절차 ``` 분석 과제 도출 → 과제 우선순위 결정 → 적용 우선순위 결정 → 분석 구현 로드맵 수립 ``` ### 우선순위 평가 기준 | 축 | 기준 | 관련 요소 | |----|------|-----------| | **시급성** (Y축) | 전략적 중요도, 목표 가치 | 비즈니스 효과 (Return) = Value | | **난이도** (X축) | 데이터 획득·저장·가공 비용 | 투자 비용 (Investment) = Volume, Variety, Velocity | ### 우선순위 매트릭스 | | 난이도 **어려움** | 난이도 **쉬움** | |---|---|---| | 시급성 **현재** | 영역 ① | 영역 ③ (**최우선**) | | 시급성 **미래** | 영역 ② | 영역 ④ | - **시급성 우선:** ③ → ④ → ② - **난이도 우선:** ③ → ① → ② - 영역 ①도 경영진 의사결정에 따라 우선순위 조정 가능 > 시험 포인트: **난이도 낮고 시급성 높은 과제(영역 ③)가 항상 최우선**입니다 (44, 46회 출제). Quick-Win 과제에 해당합니다. --- --- ## ISP (Information Strategy Planning, 정보전략계획) **중장기 정보화 추진 계획**을 수립하는 절차로, 분석 마스터플랜의 토대가 됩니다. | 단계 | 활동 | |------|------| | **환경 분석** | 비즈니스 환경, IT 트렌드, 경쟁사 분석 | | **현황 분석** | 현재 데이터·시스템·역량 진단 | | **목표 모델 수립** | To-Be 아키텍처, 분석 과제 정의 | | **이행 계획** | 우선순위, 일정, 예산, 조직 설계 | ### 분석 과제 우선순위 — 시급성 × 난이도 | | 난이도 낮음 | 난이도 높음 | |--|------------|------------| | **시급성 높음** | ✅ 1순위 | 2순위 | | **시급성 낮음** | 3순위 | ❌ 4순위 | - **Quick Win**: 시급성 높음 + 난이도 낮음 → 즉시 시작 - **Long-term**: 시급성 낮음 + 난이도 높음 → 단계적 추진 ### 분석 과제 유형 (4가지 + α) - **개선과제**: 기존 프로세스 효율화 - **혁신과제**: 새로운 비즈니스 모델 창출 - **유지과제**: 현 수준 유지를 위한 분석 - **측정과제**: KPI 모니터링 > **시험 포인트**: ISP는 정보화 전략 계획, 마스터플랜은 분석 과제의 실행 로드맵. 우선순위는 시급성×난이도 매트릭스. ### 투자 평가 지표 - **NPV(Net Present Value, 순현재가치)**: 미래 현금흐름을 할인율로 현재가치 환산 후 합산. > 0이면 투자 가치 있음 - **IRR(Internal Rate of Return, 내부수익률)**: NPV = 0이 되는 할인율. 자본비용보다 크면 투자 - **ROI(Return on Investment, 투자수익률)**: (이익 − 투자) / 투자 × 100 - **TCO(Total Cost of Ownership, 총소유비용)**: 도입·운영·폐기까지의 전체 비용 - **비즈니스 성과(Business Outcome)**: 분석이 가져오는 매출 증대·비용 절감·고객 만족 등 정량/정성 결과 ### 이행 로드맵·변화관리 - **이행계획(Implementation Plan) / 이행 로드맵**: 분석 과제를 시간 축에 배치한 실행 계획 (단기·중기·장기) - **단기 마스터플랜**: 1년 이내 Quick Win 중심 - **중장기 마스터플랜**: 3~5년 비전·전략 과제 중심 - **변화관리(Change Management)**: 새로운 분석 체계 도입에 따른 조직·프로세스·문화 변화를 관리 - **분석 과제 풀(Pool)**: 발굴된 과제들을 모아둔 관리 단위 — 우선순위에 따라 실행으로 이동 - **분석 과제 관리**: 발굴 → 우선순위 → 실행 → 성과 평가의 전체 라이프사이클 관리 ### 마스터플랜 수립 단계 1. **현재 상태 분석(As-Is)**: 분석 역량·인프라·데이터 현황 진단 2. **미래 모습 정의(To-Be)**: 비전·목표·성과 지표 설정 3. **분석 과제 발굴**: 비즈니스 영역별 분석 기회 도출 4. **과제 평가 및 우선순위**: ROI·전략적 중요도·기술 난이도 평가 5. **이행 로드맵 수립**: 단기·중기·장기 일정 ### 과제 분류 (시간축) - **단기 과제(Short-term)**: Quick Win, 6개월~1년 — 빠른 성과 확보 - **중기 과제(Mid-term)**: 1~3년 — 전사 확산 - **장기 과제(Long-term)**: 3~5년 — 비전·플랫폼 구축 ### 마스터플랜 조직 분석 - **조직 분석**: 분석 조직의 구조(집중형·기능형·분산형)·역량·문화 평가 - **분석 활용 체계**: 분석 결과를 의사결정에 연결하는 거버넌스 ### 마스터플랜 평가 관점 - **비즈니스 측면**: 전략적 중요도·ROI·비즈니스 임팩트 - **기술적 측면**: 기술 난이도·데이터 가용성·인력 역량 - 두 측면을 모두 균형 있게 평가해야 실행 가능한 마스터플랜이 됨 ### 분석 과제 평가 추가 지표 - **전략적 필요성(Strategic Necessity)**: 본원적 업무와의 연관성·실패 시 발생 위험 - **Cost of Inaction(미실행 비용)**: 과제를 하지 않을 때 발생하는 손실 - **Time-to-Market(시장 진입 시간)**: 분석 결과를 빠르게 시장에 출시 가능한지 - 우선순위 매트릭스: 전략적 중요도(高) × 시급성(高) → 즉시 추진 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **NPV** — 미래 현금흐름을 할인율로 현재가치 환산 후 합산. > 0이면 투자 가치 있음 - **IRR** — NPV = 0이 되는 할인율. 자본비용보다 크면 투자 - **이행계획(Implementation Plan) / 이행 로드맵** — 분석 과제를 시간 축에 배치한 실행 계획 (단기·중기·장기) - **변화관리** — 새로운 분석 체계 도입에 따른 조직·프로세스·문화 변화를 관리 - **분석 과제 풀** — 발굴된 과제들을 모아둔 관리 단위 — 우선순위에 따라 실행으로 이동 - **분석 과제 관리** — 발굴 → 우선순위 → 실행 → 성과 평가의 전체 라이프사이클 관리 - **단기 과제** — Quick Win, 6개월~1년 — 빠른 성과 확보 - **조직 분석** — 분석 조직의 구조(집중형·기능형·분산형)·역량·문화 평가 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터 분석 수준 진단 — 준비도와 성숙도 URL: https://adsp.todaycode.kr/study/20 태그: 빅데이터, 분석 주제 유형, 분석 성숙도, 데이터 마트, OLAP, 데이터 기반 의사결정, 데이터 웨어하우스, MLOps·최신 ML 조직이 데이터 분석을 도입하기 전에 현재 수준을 진단하는 것이 중요합니다. 진단은 분석 준비도(Readiness)와 분석 성숙도(Maturity) 두 가지 관점에서 이루어집니다. 분석 준비도는 조직이 데이터 분석을 시작할 준비가 되어 있는지를 6가지 영역으로 평가합니다. 분석 업무(현재 수행 중인 분석 업무의 수준), 인력 및 조직(분석 전문가와 조직의 역량), 분석 기법(사용 중인 분석 기법의 적절성), 분석 데이터(데이터 관리 수준과 외부 데이터 활용도), 분석 문화(데이터 기반 의사결정 문화의 정착도), IT 인프라(분석 환경과 시스템 통합 수준)가 그것입니다. 시험에서 "비용 및 예산" 또는 "재무 상태"를 준비도 평가 요소로 제시하면 틀린 보기입니다. 분석 성숙도는 CMMI(Capability Maturity Model Integration) 모델을 기반으로 도입→활용→확산→최적화의 4단계로 평가합니다. 도입 단계에서는 분석 환경과 시스템을 구축(DW, ETL, OLAP 등)하고 실적 분석 및 통계를 작성합니다. 활용 단계에서는 분석 결과를 실제 업무에 적용하고 실시간 대시보드를 활용합니다. 확산 단계에서는 전사 차원에서 분석을 관리·공유하며 비주얼 분석과 분석 전용 서버를 도입합니다. 최적화 단계에서는 분석이 조직의 혁신과 성과 향상에 직접 기여하며, 분석 Sandbox와 프로세스 내재화, 빅데이터 분석을 실행합니다. 준비도와 성숙도를 조합한 2×2 매트릭스로 조직 유형을 분류할 수 있습니다. 준비형(둘 다 낮음)은 사전 준비가 필요한 상태, 도입형(준비도 높음/성숙도 낮음)은 분석 기법은 부족하지만 조직과 인력이 준비된 상태, 정착형(준비도 낮음/성숙도 높음)은 내부에서 제한적으로 분석을 활용하는 상태, 확산형(둘 다 높음)은 6가지 구성요소를 모두 갖추어 지속적으로 확산 가능한 상태입니다. --- --- ## 핵심 요약 & 시험 포인트 ### 1) 데이터 분석 준비도 (Readiness) — 6가지 영역 | 영역 | 핵심 내용 | |------|-----------| | **분석 업무** | 사실 분석, 예측, 시뮬레이션, 최적화, 정기적 개선 | | **인력 및 조직** | 분석 전문가, 관리자 능력, 분석 조직, 경영진 이해 | | **분석 기법** | 적절한 기법, 기법 라이브러리, 평가, 정기적 개선 | | **분석 데이터** | 데이터 관리, 외부 데이터 활용, MDM(기준 데이터 관리) | | **분석 문화** | 사실 기반 의사결정, 데이터 공유·협업 | | **IT 인프라** | 운영 시스템 데이터 통합, 분석 환경 | > **시험 포인트:** **"비용 및 예산"**, **"재무 상태"**는 준비도 평가 요소가 **아닙니다** (46, 47회 출제). ### 2) 데이터 분석 성숙도 (Maturity) — CMMI 모델 기반 | 단계 | 내용 | |------|------| | **도입** | 시스템 구축, DW/ETL/OLAP, **실적 분석 및 통계 작성** | | **활용** | 분석 결과 업무 적용, 실시간 대시보드 | | **확산** | 전사 차원 분석 관리·공유, 비주얼 분석, 분석 전용 서버 | | **최적화** | 혁신·성과 향상, 분석 Sandbox, 프로세스 내재화, 빅데이터 | > **시험 포인트:** 도입 단계 = **실적 분석 및 통계 작성** (44회 출제) > > **CMMI 단계 혼동 주의:** > - 도입 ≠ 경영진 활용 시작 (도입 = 실적 분석·통계 작성) > - 활용 = 업무 적용·실시간 대시보드 (실적 분석이 아님) > - 확산 = 전사 공유·비주얼 분석 (프로세스 내재화가 아님) > - 최적화 = Sandbox·**프로세스 내재화**·빅데이터 (46, 47회 출제) --- --- ## 분석 성숙도 모델 4단계 | 단계 | 명칭 | 주요 활동 | |------|------|----------| | 1 | **도입(Introduction)** | 분석 환경/시스템 구축, 일부 부서 시범 | | 2 | **활용(Activation)** | 업무에 분석 본격 적용, 효과 측정 | | 3 | **확산(Diffusion)** | 전사 확산, 분석 문화 정착, 성과 공유 | | 4 | **최적화(Optimization)** | 분석 진화, 혁신 사례, 사업 모델 변화 | ### 분석 준비도 × 성숙도 매트릭스 (4사분면) | | 성숙도 낮음 | 성숙도 높음 | |--|------------|------------| | **준비도 높음** | **준비형** (도입 직전) | **정착형** (목표 달성) | | **준비도 낮음** | **도입형** (초기 단계) | **확산형** (실행 활발) | ### 분석 준비도 6대 영역 1. **분석 업무**: 분석 적용 업무 범위 2. **분석 인력 및 조직**: 전문 인력, 조직 체계 3. **분석 기법**: 활용 알고리즘 다양성 4. **분석 데이터**: 가용 데이터 폭과 깊이 5. **분석 문화**: 의사결정의 데이터 기반화 6. **분석 IT**: 인프라·도구 수준 > **시험 포인트**: 4단계(도입→활용→확산→최적화) 순서, 4사분면 명칭(준비형/정착형/도입형/확산형), 준비도 6대 영역 매칭. ### 분석 성숙도 4단계 - **도입(Introduction) 단계**: 분석 개념 이해, 일부 부서·과제에서 시범 시작 - **활용(Activation) 단계**: 분석이 업무 내 일부 활용, 효과 검증 - **확산(Expansion) 단계**: 전사적으로 분석이 확산, 표준화 진행 - **최적화(Optimization) 단계**: 분석이 전사 전략과 통합, 지속 개선 ### 4가지 분석 유형 (준비도 + 성숙도 조합) - **도입형**: 준비도 낮음 + 성숙도 낮음 → 기초부터 단계적 도입 - **활용형 / 정착형**: 준비도 높음 + 성숙도 낮음 → 일부 적용 후 확산 - **확산형**: 준비도 낮음 + 성숙도 높음 → 외부 협력으로 전사 확산 - **준비형**: 일부 분류 체계에서는 분석 준비도 점검 단계로 분류 ### 성숙도 평가 - **준비도 점검(Readiness Assessment)**: 분석 업무·인력·기술·자원·문화 6대 영역 평가 - **성숙도 평가(Maturity Assessment)**: 분석 활용 수준·확산 정도 평가 ### CMMI(Capability Maturity Model Integration) 원형 모델 - **CMMI**: SEI(Software Engineering Institute, 카네기멜론대)가 SW-CMM·SE-CMM 등을 통합·발전시킨 프로세스 성숙도 모델 - 조직의 SW·시스템 엔지니어링 역량을 5단계로 평가 - 분석 성숙도(도입→활용→확산→최적화)도 CMMI를 차용해 만든 모델 ### CMMI 5단계 (영문 표기) 1. **Initial(초기, 1단계)**: 일관된 프로세스 없음, 영웅적 노력에 의존 2. **Managed(관리, 2단계)** / **Repeatable**: 기본 프로젝트 관리 절차 확립 3. **Defined(정의, 3단계)**: 조직 표준 프로세스 정의, 일관성 확보 4. **Quantitatively Managed(정량적 관리, 4단계)**: 통계적 통제, 정량 측정 5. **Optimizing(최적화, 5단계)**: 지속적 개선, 혁신, 결함 예방 ### 분석 성숙도 4단계 (CMMI 차용, 영문) - **도입(Initial / Awareness)**: 환경·기반 시스템 구축 시작, 일부 부서 활용 - **활용(Managed / Leverage)**: 분석 결과 실무 적용, 대시보드 운영 - **확산(Repeatable / Diffusion)**: 전사 확산·표준화, 전담 조직 운영 - **최적화(Optimized / Optimization)**: 분석 기반 비즈니스 모델 혁신·자동화·예측 ### 분석 조직 유형 (영문) - **집중형(Centralized)**: 별도 분석 전담 조직이 전사 우선순위에 따라 일괄 수행 — DSCoE, 표준화 강점 - **분산형(Decentralized)**: 각 현업 부서에 분석 인력 배치 — 도메인 친화적, 빠른 의사결정 - **기능형(Functional) / 협업형**: 핵심 인력은 분석 전담 조직, 현업과 협업 운영 — 두 장점 균형 - **성숙도 수준(Maturity Level)**: 1~5단계로 측정되는 조직 역량 등급 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **도입단계** — 분석 개념 이해, 일부 부서·과제에서 시범 시작 - **활용단계** — 분석이 업무 내 일부 활용, 효과 검증 - **확산단계** — 전사적으로 분석이 확산, 표준화 진행 - **최적화단계** — 분석이 전사 전략과 통합, 지속 개선 - **활용형 / 정착형** — 준비도 높음 + 성숙도 낮음 → 일부 적용 후 확산 - **준비도 점검** — 분석 업무·인력·기술·자원·문화 6대 영역 평가 - **기능형(Functional) / 협업형** — 핵심 인력은 분석 전담 조직, 현업과 협업 운영 — 두 장점 균형 - **성숙도 수준** — 1~5단계로 측정되는 조직 역량 등급 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터 거버넌스와 분석 거버넌스 URL: https://adsp.todaycode.kr/study/21 태그: 분석 방법론, 우선순위 평가, 데이터 거버넌스, 기술통계, 데이터 전처리, MLOps·최신 ML 데이터 거버넌스는 전사 차원의 데이터 관리 체계를 구축하는 것입니다. 구성요소는 원칙, 조직, 프로세스 세 가지이며, 관리 대상은 마스터 데이터(핵심 기준 데이터), 메타 데이터(데이터에 대한 데이터), 데이터 사전(데이터의 정의와 규칙을 정리한 문서)입니다. 데이터 표준 용어 설정과 명명 규칙 수립 등 표준화 작업이 포함됩니다. 시험에서 "데이터 거버넌스는 전담 조직에서 독립적으로 운영되어야 한다"는 보기가 나오면 틀린 것입니다. 데이터 거버넌스는 전사 차원의 협업이 필요하며, 특정 부서만의 독립적 운영으로는 효과를 얻기 어렵습니다. 분석 거버넌스는 데이터 분석과 활용을 위한 의사결정 관리 체계입니다. 구성요소는 프로세스(Process), 조직(Organization), 시스템(System), 인적자원(Human Resource), 데이터(Data)의 다섯 가지입니다. 여기서 "분석 기법(Technology)"은 분석 거버넌스의 구성요소에 포함되지 않으므로 주의해야 합니다. 분석 조직 유형은 세 가지로 나뉩니다. 집중형 조직은 별도의 전담 조직에서 회사 차원의 우선순위에 따라 분석 업무를 일괄적으로 수행합니다. 기능형 조직은 별도의 분석 조직 없이 각 업무 부서에서 분석을 수행하므로 전사 관점의 핵심 분석이 어렵습니다. 분산형 조직은 분석 인력을 현업 부서에 직접 배치해 전사 차원의 우선순위로 분석을 수행하며, 실무 대응이 빠릅니다. --- # 제3과목 — 데이터 분석 --- --- ## 핵심 요약 & 시험 포인트 전사 차원의 **데이터 관리 체계**를 구축하는 것입니다. | 항목 | 내용 | |------|------| | **구성요소** | 원칙, 조직, 프로세스 | | **관리 대상** | 마스터 데이터, 메타 데이터, 데이터 사전 | > 시험 포인트: "데이터 거버넌스는 전담 조직에서 독립적으로 운영"은 **틀린 설명**입니다 (47회 출제). 전사 차원의 협업이 필요합니다. ### 데이터 거버넌스 vs 분석 거버넌스 비교 | 항목 | 데이터 거버넌스 | 분석 거버넌스 | |------|----------------|---------------| | **목적** | 전사 데이터 관리 체계 구축 | 데이터 분석·활용 의사결정 관리 체계 | | **구성요소** | 원칙, 조직, 프로세스 (3가지) | 프로세스, 조직, 시스템, 인적자원, 데이터 (5가지) | | **관리 대상** | 마스터 데이터, 메타 데이터, 데이터 사전 | 분석 과제, 분석 조직, 분석 프로세스 | | **포함 안 되는 것** | - | **분석 기법(Technology)**은 구성요소 아님 | > 시험 포인트: 분석 거버넌스 구성요소는 **5가지(프·조·시·인·데)**. "분석 기법(Technology)"은 포함되지 않습니다 (Q42 빈출). --- --- ## 데이터 분석 조직 구조 3가지 | 구조 | 형태 | 장점 | 단점 | |------|------|------|------| | **집중형(Centralized)** | 전사 단일 분석 조직 | 일관성·전문성, 표준화 | 현업과 거리, 우선순위 충돌 | | **기능형(Functional)** | 각 부서 내 분석 인력 분산 | 현업 밀착, 빠른 의사결정 | 사일로화, 중복 작업 | | **분산형(Distributed)** | 분석 전문가가 부서 파견 (CoE 모델) | 전문성 + 현업 결합 | 관리·보고 라인 복잡 | ### CoE (Center of Excellence) - **분산형의 대표 모델**: 중앙 분석 센터에서 인력을 부서로 파견 - 표준 방법론 + 현업 적용성 동시 확보 - 분석 거버넌스의 모범 사례로 자주 출제 > **시험 포인트**: 3가지 조직 구조의 장단점 매칭과 CoE의 의미가 자주 출제됨. --- ## 추가 핵심 개념 — 거버넌스 운영 인프라 - **데이터 카탈로그(Data Catalog)**: 조직 내 데이터 자산을 목록화해 검색·발견을 지원하는 시스템. 메타데이터 + 비즈니스 용어집 + 데이터 오너십 + 사용 통계 포함. 도구: Apache Atlas·AWS Glue·Alation·Collibra·DataHub. - **데이터 사전(Data Dictionary)**: 데이터베이스 내 테이블·컬럼의 정의·타입·제약조건을 정의한 문서. 데이터 카탈로그의 하위 개념. - **데이터 리니지(Data Lineage)**: 데이터의 출처(Source) → 변환 → 활용까지 전체 흐름을 추적하는 기능. 데이터 품질·신뢰성 보장의 핵심. - **마스터 데이터 관리(MDM, Master Data Management)**: 고객·상품·조직 등 핵심 참조 데이터의 표준화·중복 제거·일관성 유지. - **데이터 거버넌스 역할**: - **CDO**(Chief Data Officer): 전략 총괄 임원 - **Data Owner**: 도메인 책임 (비즈니스 부서) - **Data Steward**: 품질·표준 실무 관리 (현업 분석가) - **Data Custodian**: IT 저장·보안 (DBA·인프라팀) > **시험 핵심**: 데이터 거버넌스 3대 구성요소(원칙·조직·프로세스)와 4대 역할(CDO·Owner·Steward·Custodian) 매핑이 빈출입니다. ### 데이터 거버넌스 핵심 요소 - **데이터 거버넌스(Data Governance)**: 전사 데이터의 표준·품질·보안·라이프사이클을 통제·관리하는 체계 - **메타데이터(Metadata)**: 데이터에 관한 데이터(설명·구조·계보·품질). 데이터 카탈로그의 핵심 - **데이터 카탈로그**: 메타데이터를 검색·이해·활용 가능하도록 정리한 저장소 - **데이터 품질 차원**: 정확성·완전성·일관성·적시성·유효성·유일성 ### 데이터 사이언티스트 조직 - **CDO(Chief Data Officer)**: 데이터 전략·거버넌스·활용 총괄 ### 데이터 품질 관리 - **데이터 품질 관리(DQM, Data Quality Management)**: 데이터 품질 측정·개선·모니터링의 체계적 활동 - **데이터 품질 지표(6대 차원)**: 정확성·완전성·일관성·적시성·유효성·유일성 - **데이터 클렌징(Data Cleansing)**: 오류·중복·결측·이상치 식별 후 수정·표준화 ### 데이터 라이프사이클 - **데이터 라이프사이클(Data Lifecycle)**: 생성 → 수집 → 저장 → 분석·활용 → 폐기의 전 과정 - 각 단계마다 품질·보안·개인정보 요구사항이 다름 ### 데이터 표준화 - **표준 단어 사전 / 용어 사전**: 전사적으로 일관된 명칭과 정의를 보장 - **데이터 표준**: 명명 규칙·도메인 규칙·코드 표준 정의 - **데이터 매핑**: 시스템 간 데이터 항목 대응 관계 정의 ### 분석 거버넌스 체계 (4대 영역) - **분석 거버넌스 체계**: 분석을 지속·확산하기 위한 운영 프레임워크 - 핵심 요소: - **분석 인력 / 분석 조직**: 데이터 사이언티스트 양성·전문 조직 구성 - **분석 과제 관리**: 과제 발굴·우선순위·이행 모니터링 - **분석 플랫폼·인프라**: 도구·인프라 표준화 - **분석 문화 / 거버넌스 체계**: 데이터 기반 의사결정 문화 확산 - **데이터 거버넌스의 목적**: 데이터 자산화·일관성·신뢰성 확보 → 분석·활용 효율 극대화 ### 데이터 거버넌스 표준·구성요소 - **DMBOK(Data Management Body of Knowledge)**: DAMA가 정의한 데이터 관리 표준 — 거버넌스·아키텍처·품질·메타데이터·보안 등 11개 지식 영역 - **데이터 거버넌스 6대 구성요소**: 원칙·조직·프로세스·표준·정책·기술 - **정책 수립**: 데이터 활용·보안·품질에 대한 전사 정책 문서화 - **표준 정의 / 데이터 표준화**: 명명 규칙·코드·도메인 표준 정의 → 시스템 간 일관성 ### 데이터 표준화 추가 - **메타데이터 관리**: 메타데이터의 수집·저장·활용·유지보수 — 데이터 카탈로그 운영 - **데이터 프로파일링(Data Profiling)**: 데이터의 구조·내용·관계·품질을 자동 분석 - **데이터 사전(Data Dictionary)**: 데이터 항목의 정의·도메인·관계를 기록한 문서 - **MDM(Master Data Management)**: 고객·상품 등 핵심 마스터 데이터를 전사적으로 통합 관리 - **데이터 표준 단어 / 공통어 사전**: 동일 개념에 같은 용어를 쓰도록 표준화 ### 데이터 자산 관리 - **데이터 자산(Data Asset)**: 조직이 보유한 데이터를 자산으로 인식·관리 - **데이터 자산 관리**: 자산 등록·평가·라이프사이클·접근 통제 - **데이터 자산화 / 데이터 화폐화(Data Monetization)**: 데이터를 직간접 매출로 전환 ### 데이터 표준화 세부 - **용어 표준 / 코드 표준 / 도메인 표준**: 명명·코드값·데이터 타입과 범위의 일관성 - **표준 명명 규칙**: 접두사·접미사·구분자 규칙 - **데이터 거버넌스 절차**: 정책 수립 → 표준 정의 → 적용 → 점검·개선 ### DaaS (Data as a Service) - **DaaS**: 클라우드를 통한 데이터 제공 서비스 — 데이터 자체가 상품 ### 데이터 분류·등급 체계 - **데이터 분류(Data Classification)**: 데이터의 민감도·중요도에 따라 등급화 - **일반 등급 예시**: - **공개(Public)**: 자유 공개 - **내부(Internal)**: 사내 한정 - **기밀(Confidential)**: 특정 인원만 접근 - **극비(Highly Confidential / Restricted)**: 핵심 임원만 접근 - 등급에 따라 보안 통제·암호화·접근 제어 수준 결정 ### 데이터 카탈로그 도구 - **Apache Atlas**: 오픈소스 메타데이터 관리 - **Alation·Collibra·Informatica**: 상용 카탈로그 솔루션 - **DataHub(LinkedIn)·Amundsen(Lyft)**: 오픈소스 자체 개발 카탈로그 ### 데이터 거버넌스 vs 분석 거버넌스 - **데이터 거버넌스(Data Governance)**: 전사 데이터 자산의 표준·품질·보안·라이프사이클 관리 - **데이터 분석 거버넌스(Data Analytics Governance) / 분석 거버넌스**: 분석 활동·과제·플랫폼·인력의 일관된 운영 체계 - 두 개념은 상호보완적 — 데이터 거버넌스가 자원이라면 분석 거버넌스는 활용 - 분석 거버넌스 4대 영역: 인력·과제·플랫폼·문화 (이미 다룬 영역) ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **데이터 품질 차원** — 정확성·완전성·일관성·적시성·유효성·유일성 - **데이터 품질 관리** — 데이터 품질 측정·개선·모니터링의 체계적 활동 - **데이터 품질 지표** — 정확성·완전성·일관성·적시성·유효성·유일성 - **데이터 클렌징** — 오류·중복·결측·이상치 식별 후 수정·표준화 - **데이터 라이프사이클** — 생성 → 수집 → 저장 → 분석·활용 → 폐기의 전 과정 - **표준 단어 사전 / 용어 사전** — 전사적으로 일관된 명칭과 정의를 보장 - **데이터 매핑** — 시스템 간 데이터 항목 대응 관계 정의 - **분석 거버넌스 체계** — 분석을 지속·확산하기 위한 운영 프레임워크 - **분석 인력 / 분석 조직** — 데이터 사이언티스트 양성·전문 조직 구성 - **용어 표준 / 코드 표준 / 도메인 표준** — 명명·코드값·데이터 타입과 범위의 일관성 - **데이터 거버넌스 절차** — 정책 수립 → 표준 정의 → 적용 → 점검·개선 - **DaaS** — 클라우드를 통한 데이터 제공 서비스 — 데이터 자체가 상품 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. --- ## 3과목 데이터 분석 ### 통계의 기초 — 척도와 기술통계 URL: https://adsp.todaycode.kr/study/22 태그: 척도, 기술통계, 확률분포, 이상치·결측, 점추정·구간추정 통계 분석의 첫걸음은 데이터를 측정하는 척도의 종류를 이해하는 것입니다. 척도는 네 가지 수준으로 나뉘며, 각 수준에 따라 적용할 수 있는 분석 방법이 달라집니다. **명목척도**는 단순히 범주를 구분하기 위한 것으로, 숫자에 수학적 의미가 없습니다. 성별(남/여), 혈액형(A/B/O/AB), 거주지역(수도권/비수도권) 등이 해당됩니다. **서열척도**는 범주 간에 순서(서열)가 있지만 간격이 동일하지는 않습니다. 학년(1학년<2학년<3학년), 만족도 등급(매우불만<불만<보통<만족<매우만족)이 예입니다. **등간척도**는 범주 간 간격이 동일하지만 절대적 영점(0)이 없는 척도입니다. 온도(섭씨 0도가 "온도가 없다"를 뜻하지 않음), 시험 점수가 해당됩니다. **비율척도**는 절대적 영점(0)이 존재하여 비율 계산이 가능한 척도입니다. 키, 몸무게, 나이, 소득 등이 해당되며 "몸무게 0kg은 무게가 없다"를 의미합니다. 기술통계는 수집된 데이터를 표나 그래프, 수치 요약 등으로 정리하여 데이터의 특성을 파악하는 방법입니다. 대표값에는 평균(모든 값의 합을 개수로 나눈 것), 중앙값(데이터를 크기순으로 나열했을 때 가운데 값), 최빈값(가장 자주 나타나는 값)이 있습니다. 산포도 측정에는 분산, 표준편차, 사분위범위(IQR) 등이 사용됩니다. **IQR**은 제3사분위수(Q3)에서 제1사분위수(Q1)를 뺀 값으로, 데이터의 중앙 50%가 흩어진 정도를 나타냅니다. IQR은 이상치(Outlier)의 영향을 받지 않는 로버스트(Robust)한 산포 지표라는 점이 중요합니다. 상자그림(Box Plot)에서 이상치 판단 기준은 **하한=Q1-1.5×IQR, 상한=Q3+1.5×IQR**입니다. **정규분포**는 평균을 중심으로 좌우 대칭인 종 모양의 분포로, 왜도(Skewness)=0(좌우 대칭), 첨도(Kurtosis)=3(또는 초과 첨도=0)인 특성을 가집니다. "정규분포의 왜도는 1이다"라는 보기가 나오면 0이므로 틀린 설명입니다. 평균=중앙값=최빈값이 모두 같은 것도 정규분포의 중요한 특성입니다. 반면 **오른쪽(양) 꼬리 분포**에서는 최빈값 < 중앙값 < 평균이고, **왼쪽(음) 꼬리 분포**에서는 평균 < 중앙값 < 최빈값의 순서가 됩니다. --- ## 핵심 요약 & 시험 포인트 ### 4가지 척도 비교 | 척도 | 특징 | 허용 연산 | 예시 | |------|------|-----------|------| | **명목(Nominal)** | 분류만 가능, 순서 없음 | 빈도, 최빈값 | 혈액형, 성별 | | **서열(Ordinal)** | 순서 있음, 간격 불균등 | 중앙값, 순위 | 만족도 순위, 학점 | | **등간(Interval)** | 동일 간격, 절대 0 없음 | 평균, 표준편차 | 섭씨 온도, IQ | | **비율(Ratio)** | 절대 0 있음, 비율 의미 | 모든 연산 | 키·몸무게·연봉 | ### 분포의 모양과 대표값 순서 | 분포 | 순서 | |------|------| | **정규분포** | 평균 = 중앙값 = 최빈값 | | **오른쪽 꼬리(양의 왜도)** | 최빈값 < 중앙값 < **평균** | | **왼쪽 꼬리(음의 왜도)** | **평균** < 중앙값 < 최빈값 | > **시험 포인트:** 등간척도의 절대 0 예 = 섭씨 온도(0°C는 온도 없음이 아님). 비율척도의 절대 0 예 = 몸무게(0kg = 없음). 정규분포 왜도=0, 첨도=3. --- --- ## 모집단 vs 표본, 모수 vs 통계량 | 개념 | 모집단(Population) | 표본(Sample) | |------|------------------|--------------| | 정의 | 관심 대상 전체 | 모집단의 일부 (조사 대상) | | 측정값 | **모수(Parameter)** | **통계량(Statistic)** | | 표기 | μ(평균), σ(표준편차), p(비율) | x̄, s, p̂ | | 성격 | 고정된 상수 (보통 미지수) | 표본마다 변하는 확률변수 | ### 추정(Estimation)의 두 가지 방법 - **점추정(Point Estimation)**: 모수를 하나의 값으로 추정 (x̄으로 μ 추정) - **구간추정(Interval Estimation)**: 신뢰구간으로 추정 (95% CI) ### 좋은 추정량의 성질 | 성질 | 의미 | |------|------| | **불편성(Unbiasedness)** | E(추정량) = 모수 (편향이 0) | | **효율성(Efficiency)** | 분산이 가장 작은 추정량 | | **일치성(Consistency)** | 표본 크기 n→∞ 일 때 모수에 수렴 | | **충분성(Sufficiency)** | 모수에 대한 모든 정보를 담음 | > **시험 포인트**: 모수는 고정된 미지의 상수, 통계량(표본 통계)은 확률변수. 표본평균 x̄은 모평균 μ의 **불편추정량**. ### 분포 형태 측정 지표 - **표본분산(s²)**: Σ(x - x̄)² / (n−1) — 자유도(n−1)를 사용하는 불편추정량 - **표본표준편차(s)**: √s² — 분산의 단위를 원자료와 일치시킨 산포 측도 - **변동계수(CV, Coefficient of Variation)**: (표준편차 / 평균) × 100 — 단위·평균이 다른 그룹 간 산포 비교 시 사용. 평균이 0에 가까우면 사용 불가 - **왜도(Skewness)**: 분포 비대칭 정도. >0 우측 꼬리(오른쪽으로 치우침), <0 좌측 꼬리, =0 대칭 - **첨도(Kurtosis)**: 분포 뾰족함. 정규분포=3(Fisher 정의로는 0), >0 더 뾰족, <0 더 평평 ### 평균의 종류 - **산술평균**: 일반적 평균 (Σx/n) - **기하평균**: ⁿ√(x₁·x₂···xₙ) — 비율·성장률 평균에 사용 - **조화평균**: n / Σ(1/xᵢ) — 속도·F1-score 등 비율의 평균 ### Z-점수와 백분위수 - **Z-점수**: (x − μ) / σ — 평균에서 몇 표준편차 떨어졌는지. 표준정규분포로 변환 - **백분위수(Percentile)**: 자료를 작은 값부터 정렬 시 p%에 해당하는 위치값. Q1=25%, Q2(중앙값)=50%, Q3=75% ### 4대 척도 (Stevens, 1946) - **명목척도(Nominal Scale)**: 분류만 가능 (성별·혈액형) — 산술 연산 불가 - **서열척도(Ordinal Scale)**: 순서 의미 (등급·만족도) — 크기 비교 가능, 간격은 동일하지 않음 - **등간척도(Interval Scale)**: 간격이 일정 (온도·연도) — 덧셈/뺄셈 가능, 절대 0 없음 - **비율척도(Ratio Scale)**: 절대 0 존재 (무게·길이·소득) — 모든 연산 가능 - 척도가 높을수록 더 많은 통계 분석 가능 — Nominal < Ordinal < Interval < Ratio ### 도수분포와 그래프 - **도수(Frequency)**: 각 계급(class)에 속하는 자료의 개수 - **상대도수(Relative Frequency)**: 도수 / 전체 — 비율 - **누적도수(Cumulative Frequency)**: 해당 계급까지의 도수 합 - **도수분포표**: 계급별 도수·상대도수·누적도수를 표로 정리 - **줄기-잎 그림(Stem-and-Leaf)**: 줄기(상위 자릿수) + 잎(하위 자릿수)으로 분포 표시 — 원자료 보존 - **단봉(Unimodal)/다봉(Multimodal)/이봉(Bimodal)**: 분포의 봉우리 수 — 하위 집단 존재 시 다봉 ### 대칭·왜도 - **대칭도(Symmetry)**: 평균을 중심으로 좌우 대칭 정도 - **비대칭도(Asymmetry, Skewness)**: 왜도와 동일 개념 - **MAD(Median Absolute Deviation, 중앙값 절대편차)**: 중앙값 기반 산포 측도 — 이상치에 강건 ### 통계학의 두 갈래 - **기술 통계(Descriptive Statistics)**: 자료를 요약·시각화·정리하는 통계 - 평균·중앙값·최빈값(중심 경향) - 분산·표준편차·범위·IQR(산포) - 왜도·첨도(분포 형태) - 표·그래프·도수분포 - **추론 통계(Inferential Statistics)**: 표본으로 모집단을 추정·검정·예측 - 점추정·구간추정 - 가설검정 - 회귀·상관 분석 ### 분석 단계별 명칭 - **기술적 분석(Descriptive Analytics)**: 무슨 일이 일어났는가 — 기술 통계와 시각화 - **진단적 분석(Diagnostic)**: 왜 일어났는가 - **예측적 분석(Predictive)**: 무엇이 일어날 것인가 - **처방적 분석(Prescriptive)**: 무엇을 해야 하는가 ### 강건 통계량 - **절사평균(Trimmed Mean)**: 양 끝의 일정 비율(예: 10%)을 제외하고 계산한 평균 — 이상치에 강건 - **윈저화 평균(Winsorized Mean)**: 극단값을 임계값으로 대체 후 평균 — 데이터를 제거하지 않음 - **MAD(Median Absolute Deviation)**: 중앙값 기준 절대편차의 중앙값 — 강건 산포 측도 ### 변동성 지표 - **Variation Ratio(분산도)**: 1 − (최빈도/전체) — 범주형 자료의 산포 측도 - **거리 상관(Distance Correlation)**: 비선형 관계까지 포착하는 일반화 상관 — 0이면 독립을 함의 ### 정리·이론 - **Gauss-Markov 정리(마르코프 정리)**: OLS 추정량이 BLUE(Best Linear Unbiased Estimator) — 선형 무편 추정량 중 최소 분산 ### 산포 측도 추가 - **범위(Range)**: 최댓값 − 최솟값 — 가장 단순한 산포 측도, 이상치에 매우 민감 - **사분위 범위(IQR, Interquartile Range)**: Q3 − Q1 — 이상치에 강건 - **극값(Extreme Value)**: 분포의 양 끝 극단값 - **극값 이론(EVT, Extreme Value Theory)**: 드물게 발생하는 극단 사건의 분포를 모형화 — 금융 리스크·기상 극단 사건 분석 ### KS 통계량과 차트 - **Kolmogorov-Smirnov 통계량(KS Statistic)**: 두 분포의 누적분포함수 최대 차이 - **KS Curve / KS Chart**: 모형의 양성·음성 클래스 누적분포의 차이를 시각화 — 모델 변별력 평가 - **KS Score**: max(cumulative_TPR − cumulative_FPR) — 신용 평가 모델에서 표준 ### 지니계수 (Gini Coefficient) — 소득 분포 - **Gini Coefficient(지니계수) / Gini Index**: 소득·자산 불평등 측정 지표 (의사결정나무의 Gini Impurity와 다름) - 0 = 완전 평등, 1 = 완전 불평등 - **로렌츠 곡선(Lorenz Curve)**: 누적 인구 비율 대 누적 소득 비율 곡선 - 지니계수 = 완전 평등선과 로렌츠 곡선 사이 면적의 2배 ### 두 지니의 구분 - **Gini Impurity(불순도, ML)**: 1 − Σpᵢ² — 의사결정나무 분할 기준 - **Gini Coefficient(계수, 경제)**: 로렌츠 곡선 기반 불평등 측정 - 명칭은 같으나 활용 분야가 다름 (둘 다 Corrado Gini가 제안) ### 자유도 (Degrees of Freedom) 총정리 - **자유도(df)**: 통계량 계산에서 자유롭게 변할 수 있는 독립적인 값의 수 - 평균에 사용된 후 n−1개만 자유 → 분산 자유도 = n−1 - **카이제곱**: df에 따라 분포 모양 결정 - **t 분포**: df → ∞ 이면 정규분포 - **F 분포**: 두 카이제곱의 비율 — df₁, df₂ 두 개의 자유도 ### Pearson 카이제곱 - **Pearson 카이제곱 통계량**: χ² = Σ(O−E)²/E - Karl Pearson(1857-1936)이 1900년에 제안 - 통계학의 기초가 된 검정 — 적합도·독립성·동질성에 모두 활용 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **표본분산** — Σ(x - x̄)² / (n−1) — 자유도(n−1)를 사용하는 불편추정량 - **표본표준편차** — √s² — 분산의 단위를 원자료와 일치시킨 산포 측도 - **변동계수** — (표준편차 / 평균) × 100 — 단위·평균이 다른 그룹 간 산포 비교 시 사용. 평균이 0에 가까우면 사용 불가 - **기하평균** — ⁿ√(x₁·x₂···xₙ) — 비율·성장률 평균에 사용 - **Z-점수** — (x − μ) / σ — 평균에서 몇 표준편차 떨어졌는지. 표준정규분포로 변환 - **백분위수** — 자료를 작은 값부터 정렬 시 p%에 해당하는 위치값. Q1=25%, Q2(중앙값)=50%, Q3=75% - **도수분포표** — 계급별 도수·상대도수·누적도수를 표로 정리 - **줄기-잎 그림** — 줄기(상위 자릿수) + 잎(하위 자릿수)으로 분포 표시 — 원자료 보존 - **극값 이론** — 드물게 발생하는 극단 사건의 분포를 모형화 — 금융 리스크·기상 극단 사건 분석 - **KS Curve / KS Chart** — 모형의 양성·음성 클래스 누적분포의 차이를 시각화 — 모델 변별력 평가 - **로렌츠 곡선** — 누적 인구 비율 대 누적 소득 비율 곡선 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 확률의 기초와 확률분포 URL: https://adsp.todaycode.kr/study/23 태그: 기술통계, 확률분포, 확률, 점추정·구간추정 확률이란 어떤 사건이 일어날 가능성을 0에서 1 사이의 숫자로 나타낸 것입니다. 확률이 0이면 절대 일어나지 않고, 1이면 반드시 일어나며, 0.5이면 일어날 가능성과 일어나지 않을 가능성이 같습니다. 두 사건이 **독립사건**(서로 영향을 주지 않음)이고, 독립일 때, 두 사건이 동시에 일어날 확률은 각 사건의 확률을 곱한 것입니다. P(A∩B)=P(A)×P(B)입니다. 시험에서 "두 독립 사건의 동시 발생 확률은 두 확률의 합"이라는 보기가 나오면 틀린 것입니다. 합이 아니라 곱입니다. **조건부확률**은 사건 A가 일어났을 때 사건 B가 일어날 확률로 P(B|A)=P(A∩B)/P(A)로 계산합니다. **베이즈 정리**는 조건부확률을 이용해 사전확률로부터 사후확률을 계산하는 이론입니다. P(A|B) = P(B|A)×P(A)/P(B) 형태로 표현되며, 새로운 증거(B)를 관찰한 후에 기존의 믿음(사전확률 P(A))을 업데이트하여 사후확률 P(A|B)를 구합니다. 예) 스팸 필터: 단어 'FREE'가 등장할 때 스팸일 확률을 계산하는 데 사용합니다. **기대값**은 확률변수가 취할 수 있는 각 값에 해당 확률을 곱하여 모두 더한 것입니다. 예를 들어 P(X=1)=0.4, P(X=2)=0.3, P(X=3)=0.2, P(X=4)=0.1이면 E(X)=1×0.4+2×0.3+3×0.2+4×0.1=2.0입니다. **중심극한정리**는 모집단의 분포가 어떤 형태이든, 표본의 크기가 충분히 크면 표본 평균의 분포가 정규분포에 가까워진다는 정리입니다. 모집단이 반드시 정규분포를 따를 필요는 없으며, 모집단의 분포가 비대칭일수록 정규분포에 가까워지기 위해 더 큰 표본 크기가 필요합니다. 일반적으로 표본 크기 **n≥30**이면 중심극한정리를 적용할 수 있다고 봅니다. "중심극한정리는 모집단이 정규분포를 따를 때만 성립한다"는 보기가 나오면 틀린 설명입니다. --- --- ## 주요 확률분포 정리 ### 이산확률분포 | 분포 | 의미 | 모수 | |------|------|------| | **이항분포 B(n,p)** | n번 시행 중 성공 횟수 | n, p | | **포아송 P(λ)** | 일정 시간 내 사건 발생 횟수 | λ (평균=분산) | | **기하분포** | 첫 성공까지의 시행 횟수 | p | | **음이항분포** | r번째 성공까지의 시행 횟수 | r, p | ### 연속확률분포 | 분포 | 의미 | 특징 | |------|------|------| | **균등분포 U(a,b)** | [a,b] 사이 모든 값이 같은 확률 | 평균=(a+b)/2 | | **정규분포 N(μ,σ²)** | 종 모양 좌우대칭 | 평균=중앙값=최빈값 | | **지수분포 Exp(λ)** | 사건 간 시간 간격, **무기억성** | 평균=1/λ | | **카이제곱(χ²)** | 정규분포 제곱합 (자유도 k) | 분산 추정·검정 | | **t분포** | 표본이 작을 때 정규 대신 (자유도 n-1) | 평균 추정 | | **F분포** | 두 카이제곱의 비 | ANOVA·분산 비교 | > **시험 포인트**: 포아송은 평균=분산. 지수분포는 "무기억성" (기억하지 않음). t분포는 자유도가 커지면 정규분포에 수렴. --- ## 추가 핵심 개념 — 베르누이 시행과 분포 관계 - **베르누이 시행(Bernoulli Trial)**: 결과가 성공(1)·실패(0)로만 나타나는 단일 시행. P(X=1) = p, P(X=0) = 1-p. 평균 = p, 분산 = p(1-p). - **이항분포 B(n, p)**: 베르누이 시행을 n번 반복한 성공 횟수의 분포. 평균 = np, 분산 = np(1-p). - **분포 간 근사 관계**: - 이항 B(n, p): n↑·p작음(np=λ 일정) → **포아송 P(λ)** 근사 (드문 사건) - 이항 B(n, p): n↑·p≈0.5 → **정규분포 N(np, np(1-p))** 근사 (CLT) - 포아송 사건 간격 → **지수분포 Exp(λ)** (무기억성, Memoryless) - **백색잡음(White Noise)**: 평균 0·일정 분산·자기상관 0인 정상 시계열. ARIMA 잔차의 이상적 가정. > **시험 핵심**: 베르누이 → 이항 → 포아송 → 지수의 관계와 근사 조건이 시계열·확률에서 자주 묶여 출제됩니다. ### 베이지안 추론 - **베이즈 정리**: P(A|B) = P(B|A)·P(A) / P(B) - **사전확률(Prior)**: 데이터 관찰 전 신념. P(A) - **우도(Likelihood)**: 가설이 참일 때 데이터가 관찰될 확률. P(B|A) - **사후확률(Posterior)**: 데이터 관찰 후 갱신된 신념. P(A|B) - **최대우도추정(MLE, Maximum Likelihood Estimation)**: 우도함수를 최대화하는 모수 추정. 회귀·로지스틱회귀·신경망 학습의 기본 원리 - **베이지안 추론**: 빈도주의(고정 모수)와 달리 모수를 확률변수로 보고 사전·사후 분포로 업데이트 ### 표본분포 관련 - **표준오차(SE)**: 추정량의 표준편차. 표본평균의 SE = σ/√n ### 확률 함수 종류 - **확률질량함수(PMF, Probability Mass Function)**: 이산형 확률변수의 각 값에 대한 확률 - **확률밀도함수(PDF, Probability Density Function)**: 연속형 확률변수의 밀도 — 적분이 확률 - **누적분포함수(CDF, Cumulative Distribution Function)**: P(X ≤ x) — 모든 확률변수에 정의 ### 추가 분포 - **초기하분포(Hypergeometric)**: 비복원추출에서 성공 횟수 분포 (예: 모집단 N개 중 K개 성공, n개 비복원 추출) - **기하분포(Geometric)**: 첫 성공까지의 시행 횟수 - **음이항분포(Negative Binomial)**: r번째 성공까지의 시행 횟수 - **감마분포(Gamma)**: 양의 연속 확률변수 — 대기시간·수명 분석에 사용 - **베타분포(Beta)**: [0, 1] 구간의 연속분포 — 비율·확률의 사전분포로 자주 사용 - **t 분포**: 정규분포와 유사하나 꼬리 두꺼움. 자유도가 커질수록 정규에 수렴 — 소표본 평균검정에 사용 - **F 분포**: 두 카이제곱 분포의 비율 — ANOVA·분산비 검정에 사용 ### 통계 극한정리 - **큰 수의 법칙(LLN)**: 표본 크기가 커질수록 표본평균이 모평균에 수렴 - **중심극한정리(CLT)**: 표본 크기가 충분히 크면 표본평균의 분포가 정규분포에 근사 - **체비셰프 부등식(Chebyshev)**: 분포 형태와 무관하게 P(|X−μ| ≥ kσ) ≤ 1/k² ### 베르누이 분포 - **베르누이 시행(Bernoulli Trial)**: 결과가 성공/실패 둘뿐인 시행 - **베르누이 분포 Bern(p)**: P(X=1) = p, P(X=0) = 1−p — 이항분포의 기본 단위 - **기댓값 E(X) = p, 분산 Var(X) = p(1−p)** ### 기댓값과 분산의 성질 - **E(aX + b) = aE(X) + b** - **Var(aX + b) = a²Var(X)** (b는 영향 없음) - **독립 시**: Var(X+Y) = Var(X) + Var(Y) - **공분산이 있을 때**: Var(X+Y) = Var(X) + Var(Y) + 2Cov(X, Y) ### 조건부 확률 - **조건부 확률**: P(A|B) = P(A∩B) / P(B) - **전확률의 정리**: P(A) = Σ P(A|Bᵢ)P(Bᵢ) — 표본공간 분할 활용 - **사건의 독립**: P(A∩B) = P(A)P(B) ⇔ P(A|B) = P(A) ### 다변량 정규분포 - **다변량 정규분포(Multivariate Normal Distribution, MVN)**: 여러 변수가 결합 정규분포를 따르는 분포 - 모수: 평균 벡터 μ와 공분산행렬 Σ - **표준화 변량**: (X − μ) / σ — 단변량 표준화의 일반화는 마할라노비스 거리 - **이항확률**: 베르누이 시행을 n번 반복한 성공 횟수의 분포 — Bin(n, p) - **확률밀도(PDF)와 확률분포함수(CDF)의 구분**: PDF는 미분, CDF는 적분으로 연결 ### 모수 표기 - **모분산(σ², Population Variance)**: 모집단의 분산 - **모표준편차(σ)**: 모분산의 제곱근 - **모비율(p, Population Proportion)**: 모집단에서 특정 속성의 비율 - 모수는 일반적으로 알 수 없고, 표본통계량으로 추정 ### 모형의 분류 - **확률 모형(Stochastic / Probabilistic Model)**: 무작위성을 가진 모형 — 같은 입력에서 다른 결과 가능 (예: 회귀, 마르코프, 베이지안) - **결정 모형(Deterministic Model)**: 입력이 같으면 항상 같은 결과 — 수학적 공식·물리 모델 - 빅데이터·ML 모형은 대부분 확률 모형 ### 확률의 공리 (Kolmogorov) 1. **비음성**: P(A) ≥ 0 2. **정규화**: P(전체 표본공간) = 1 3. **가법성**: 서로 배반 사건이면 P(A∪B) = P(A) + P(B) ### 선형대수와 확률 - **양의 정부호(Positive Definite) / PSD(Positive Semi-Definite, 양의 준정부호)**: 모든 고유값이 양수(또는 0 이상)인 행렬 — 공분산행렬은 항상 PSD - **공분산행렬의 PSD 성질**: 분산이 음수가 될 수 없음에서 유도 - **정규화 상수(Normalizing Constant) / Evidence**: 베이즈 정리의 분모 P(데이터) — 사후분포가 확률이 되도록 정규화 ### 포아송 분포 추가 - **포아송 분포(Poisson Distribution)**: 단위 시간·공간에서의 사건 발생 횟수 — Pois(λ) - 평균 = 분산 = λ (포아송의 특성) - 응용: 콜센터 통화 수, 단위 면적당 결함 수, 단위 시간 방문자 수 ### 다변량 확률 분포 - **결합분포(Joint Distribution)**: 두 개 이상의 확률변수의 동시 분포 P(X, Y) - **주변분포(Marginal Distribution)**: 결합분포에서 하나의 변수에 대한 분포 P(X) = ΣP(X, Y) - **조건분포(Conditional Distribution)**: 한 변수가 주어졌을 때 다른 변수의 분포 P(Y|X) = P(X, Y)/P(X) - **독립**: P(X, Y) = P(X)·P(Y) ⇔ P(Y|X) = P(Y) - **배반사건(Mutually Exclusive)**: P(A∩B) = 0 — 동시 발생 불가 - **독립 vs 배반**: 독립과 배반은 다른 개념 (배반이면 보통 독립 아님) ### 표본평균의 표준오차 (SE) - **표본평균의 표준오차(SE of Sample Mean)**: σ_X̄ = σ / √n - σ: 모표준편차 - n: 표본 크기 - 표본이 커질수록 표준오차 감소 → 표본평균이 모평균에 가까워짐 - 모표준편차를 모르면 표본표준편차 s로 대체: SE = s / √n - **신뢰구간 = X̄ ± z·SE** (z는 임계값, 95%면 1.96) ### 표본비율의 표준오차 - **표본비율의 표준오차**: SE_p̂ = √[p̂(1−p̂)/n] - 표본 크기에 따라 신뢰구간 폭 결정 ### 자유도 추가 정리 - **자유도(Degrees of Freedom)**: 통계량 계산에서 자유롭게 변할 수 있는 값의 수 - 표본분산 s²: df = n−1 (평균이 고정되어 1 차감) - 카이제곱·t·F 분포는 자유도가 분포 모양을 결정 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **베이지안 추론** — 빈도주의(고정 모수)와 달리 모수를 확률변수로 보고 사전·사후 분포로 업데이트 - **확률질량함수** — 이산형 확률변수의 각 값에 대한 확률 - **초기하분포** — 비복원추출에서 성공 횟수 분포 (예: 모집단 N개 중 K개 성공, n개 비복원 추출) - **감마분포** — 양의 연속 확률변수 — 대기시간·수명 분석에 사용 - **베타분포** — [0, 1] 구간의 연속분포 — 비율·확률의 사전분포로 자주 사용 - **t 분포** — 정규분포와 유사하나 꼬리 두꺼움. 자유도가 커질수록 정규에 수렴 — 소표본 평균검정에 사용 - **F 분포** — 두 카이제곱 분포의 비율 — ANOVA·분산비 검정에 사용 - **큰 수의 법칙** — 표본 크기가 커질수록 표본평균이 모평균에 수렴 - **체비셰프 부등식** — 분포 형태와 무관하게 P(|X−μ| ≥ kσ) ≤ 1/k² - **E= aE+ b** — **Var(aX + b) = a²Var(X)** (b는 영향 없음) - **표준화 변량** — (X − μ) / σ — 단변량 표준화의 일반화는 마할라노비스 거리 - **이항확률** — 베르누이 시행을 n번 반복한 성공 횟수의 분포 — Bin(n, p) - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 표본추출 방법 URL: https://adsp.todaycode.kr/study/24 태그: 표본추출, 군집분석, 모형 평가, 표본조사 모집단 전체를 조사하기 어려울 때 일부를 추출하여 조사하는 것이 표본조사입니다. 표본추출 방법에는 네 가지가 있습니다. **단순무작위추출법**은 모집단의 모든 개체가 동일한 확률로 추출되는 가장 기본적인 방법입니다. **계통추출법(체계추출법)**은 모집단에 일련번호를 부여한 후, N/n=k(추출 간격)를 계산하여 1~k 중 첫 번째 표본을 무작위로 선택(r)하고, 이후 r, r+k, r+2k, ... 순으로 일정 간격으로 표본을 선택하는 방법입니다. 규칙성이 있는 모집단에 적용 시 편향이 발생할 수 있다는 단점이 있습니다. **층화추출법**은 모집단을 서로 중복되지 않는 여러 그룹(층, strata)으로 나눈 다음, 각 층에서 무작위로 표본을 추출하는 방법입니다. 모집단의 특성을 잘 반영할 수 있다는 장점이 있습니다. **집락추출법(군집추출법)**은 모집단을 여러 집단(군집)으로 나눈 후 일부 군집을 먼저 선택하고, 선택된 군집 내에서 표본을 추출하는 다단계 방법입니다. 표본조사에서 발생하는 오차는 표본오차와 비표본오차로 나뉩니다. **표본오차**는 표본이 모집단을 완벽히 대표하지 못해서 생기는 오차이며, 표본 크기가 커질수록 줄어듭니다. **비표본오차**는 측정 실수, 응답 거부, 잘못된 질문 설계 등 표본 추출 방법과 무관하게 발생하는 오차입니다. "표본추출을 통해 비표본오차를 최소화할 수 있다"는 설명은 틀린 것입니다. --- ## 핵심 요약 & 시험 포인트 ### 4가지 표본추출 방법 | 방법 | 절차 | 특징 | |------|------|------| | **단순무작위추출** | 모든 개체 동일 확률 | 가장 기본, 전제 조건 | | **계통추출(체계추출)** | 간격 k=N/n으로 일정 추출 | 주기적 패턴 있으면 편향 발생 위험 | | **층화추출** | 층(strata) 구분 후 각 층에서 무작위 | 모집단 특성 잘 반영 | | **집락추출(군집추출)** | 군집 선택 후 내부 추출 | 비용 절감, 다단계 추출 | ### 오차 구분 | 오차 | 의미 | 줄이는 방법 | |------|------|-------------| | **표본오차** | 표본이 모집단을 완벽 대표 못해 발생 | 표본 크기 증가 | | **비표본오차** | 측정 실수·응답 거부·설계 오류 등 | 표본추출로 해결 불가 | > **시험 포인트:** 계통추출법은 주기적 패턴 모집단에서 **편향 위험**. "비표본오차는 표본추출로 최소화"는 **틀린 설명**. 집략→**집락**추출법이 정확한 표기. --- --- ## 확률 표본추출 4가지 방법 (필수 암기) | 방법 | 절차 | 장단점 | |------|------|------| | **단순랜덤추출** (Simple Random Sampling) | 모집단에서 무작위 n개 추출 | 단순/공정, 모집단 정보 필요 | | **계통추출** (Systematic Sampling) | k번째마다 추출 (k = N/n) | 간편, 주기성 있으면 편향 | | **층화추출** (Stratified Sampling) | 모집단을 동질 층(Stratum)으로 나누고 비율대로 추출 | 정밀도↑, 층 정의 필요 | | **집락추출** (Cluster Sampling) | 모집단을 집락(Cluster)으로 나눠 일부 집락 전체 조사 | 비용↓, 정확도↓ | ### 층화 vs 집락 비교 (시험 단골) | 구분 | 층화추출 | 집락추출 | |------|---------|---------| | 그룹 내 동질성 | **높음** (비슷한 것끼리) | 낮음 (전체 모집단 축소판) | | 그룹 간 동질성 | 낮음 (층끼리 다름) | 높음 | | 표본 추출 | 모든 층에서 추출 | **일부 집락만** 선택 | ### 비확률 표본추출 - **편의추출**: 접근하기 쉬운 대상 (표본 편향 위험) - **할당추출**: 특정 비율로 미리 할당 (조사원 판단) - **눈덩이추출**: 응답자가 다른 응답자 소개 (희귀 모집단) > **시험 포인트**: 층화는 "층 내 동질·층 간 이질", 집락은 그 반대. 계통추출은 주기성에 주의. --- ## 추가 핵심 개념 — 중심극한정리와 복원/비복원 추출 - **중심극한정리(CLT, Central Limit Theorem)**: 표본 크기 n이 충분히 크면(보통 n ≥ 30) 모집단 분포 형태와 무관하게 표본평균 X̄의 분포가 정규분포 N(μ, σ²/n)에 근사. 표준오차 SE = σ/√n. - **복원추출(Sampling with Replacement)**: 추출한 표본을 모집단에 되돌려놓고 다시 추출. 같은 개체가 여러 번 선택 가능. 부트스트랩(Bootstrap)·배깅의 기반. - **비복원추출(Sampling without Replacement)**: 한 번 추출된 개체는 다시 뽑지 않음. 모집단이 충분히 클 때는 복원추출과 거의 같은 결과. - **부트스트랩(Bootstrap)**: 원본 데이터에서 동일 크기 n의 표본을 복원추출로 반복 생성해 통계량의 분포·신뢰구간을 추정. **OOB(Out-Of-Bag)** = 부트스트랩에 한 번도 뽑히지 않는 약 36.8%(= 1/e) 데이터로 랜덤포레스트 검증에 활용. > **시험 핵심**: CLT의 n ≥ 30 조건, 부트스트랩의 OOB ≈ 36.8% (=1/e)는 자주 출제됩니다. ### 평가 데이터 분할 방식 - **홀드아웃(Holdout)**: 데이터를 학습/검증/평가로 단순 분할 (예: 70/15/15). 가장 단순하나 분할에 따른 분산 큼 - **K-겹 교차검증(K-fold Cross-Validation)**: 데이터를 K개 폴드로 나눠 K번 학습·평가 후 평균. K=5 또는 10이 일반적 - **계층적 K-겹(Stratified K-fold)**: 각 폴드에 클래스 비율을 유지 — 불균형 데이터에 권장 - **Leave-one-out(LOOCV)**: K = n인 극단적 K-fold. 정확하나 계산 비용 큼(n번 학습) - **부트스트랩 vs 교차검증**: 부트스트랩은 복원추출, K-fold는 비복원 분할 ### 표본추출 방법 정리 - **단순임의추출(Simple Random Sampling)**: 모든 원소가 동일한 확률로 추출 — 가장 기본 - **계통추출(Systematic Sampling)**: k = N/n 간격으로 일정하게 추출 (예: 매 10번째) - **층화추출(Stratified Sampling)**: 모집단을 동질적인 층으로 나누고 각 층에서 임의 추출 — 층 내 동질·층 간 이질 - **군집추출(Cluster Sampling)**: 모집단을 군집으로 나누고 일부 군집 전체를 조사 — 비용 절감 - **비복원 vs 복원**: 추출된 표본을 다시 모집단에 넣는지 여부 ### 불균형 데이터 샘플링 - **오버샘플링(Oversampling)**: 소수 클래스를 복제·합성하여 늘림 (예: SMOTE·ADASYN) - **언더샘플링(Undersampling)**: 다수 클래스를 일부만 선택하여 줄임 (예: Tomek Links·ENN) - **SMOTE-ENN / SMOTETomek**: 합성 + 정제를 결합한 하이브리드 기법 ### 비확률 표본추출 (Non-probability Sampling) - **편의추출(Convenience Sampling)**: 가장 접근하기 쉬운 표본 (대학생·온라인 사용자) — 편향 가능성 큼 - **판단추출(Judgment Sampling)**: 연구자의 판단으로 대표성 있다고 판단되는 표본 선택 - **할당추출(Quota Sampling)**: 모집단의 비율과 동일하게 할당 (예: 성별·연령별 비율) - **눈덩이 추출(Snowball Sampling)**: 초기 표본이 다른 표본을 추천 — 희귀집단·은밀한 모집단 조사에 사용 ### 확률 vs 비확률 표본 - **확률표본(Probability Sample)**: 모든 원소의 추출 확률이 알려져 있음 → 통계적 추론 가능 - **비확률표본**: 추출 확률 불명 → 일반화 어려움, 탐색적 연구에 사용 ### 추정량의 좋은 성질 - **점추정(Point Estimation)**: 모수의 단일값 추정 - **구간추정(Interval Estimation)**: 신뢰구간 형태로 추정 - **추정량(Estimator)**: 표본 함수 (예: 표본평균 X̄) - **불편성(Unbiasedness)**: E(추정량) = 모수 — 편향 없음 - **효율성(Efficiency)**: 분산이 작을수록 효율적 - **일치성(Consistency)**: 표본 크기가 커지면 모수에 확률수렴 - **충분성(Sufficiency)**: 표본 정보를 모두 사용 - **표본통계량(Sample Statistic)**: 표본에서 계산된 값 (X̄·s·p̂) ### 복원 vs 비복원 추출 - **복원 표본(Sampling with Replacement)**: 한 번 뽑은 원소를 다시 모집단에 넣음 — 부트스트랩의 기본 - **비복원 표본(Sampling without Replacement)**: 뽑은 원소를 제외 — 같은 원소가 두 번 등장 안 함 - 모집단이 충분히 크면 두 방식의 결과가 거의 동일 ### 데이터 분할 (Train/Validation/Test) - **훈련 집합(Training Set)**: 모델 학습용 — 보통 60~80% - **검증 집합(Validation Set)**: 하이퍼파라미터 튜닝·모델 선택 — 10~20% - **시험 집합(Test Set)**: 최종 성능 평가용 — 10~20% - 흔한 비율: 70/15/15 또는 60/20/20 - **검증용 데이터(Validation Data) vs 시험용 데이터(Test Data)**: 검증은 모델 선택, 시험은 최종 평가 — 시험 데이터는 학습·튜닝에 절대 사용 금지 ### 표본통계량 핵심 - **표본 평균(x̄)**: Σxᵢ / n — 모평균 μ의 비편향 추정량 - **표본 분산(s²)**: Σ(xᵢ−x̄)² / (n−1) — 모분산 σ²의 비편향 추정량 (분모 n−1은 자유도) - **표본 비율(p̂)**: 성공 횟수 / n — 모비율 p의 비편향 추정량 - **비편향 추정량(Unbiased Estimator)**: E(추정량) = 모수 — 편향이 0인 추정량 - 분모를 n으로 하면 분산은 편향됨(편향된 분산) → 자유도 보정 필요 ### 표본 분포 관련 - **표본 분산의 분포**: (n−1)s²/σ² ~ χ²(n−1) — 정규 모집단 가정 - **표본 비율의 분포**: 큰 표본에서 N(p, p(1−p)/n)으로 근사 (CLT) ### 표본 편향 - **선택 편향(Selection Bias)**: 비무작위 표본 추출로 인한 체계적 편향 - 자가선택 편향(Self-selection bias) - 비응답 편향(Non-response bias) - 생존자 편향(Survivorship bias) - **표본통계량의 분포(Sampling Distribution)**: 동일한 모집단에서 무한히 표본 추출 시 표본통계량이 따르는 분포 ### 인과 추론용 표본 매칭 - **성향 점수(Propensity Score)**: 관측 공변량으로 처치 받을 확률을 추정 - **성향 점수 매칭**: 처치·통제 집단에서 비슷한 성향 점수를 가진 짝을 매칭 → 관측 가능 교란 완화 ### 오차의 종류 - **표본오차(Sampling Error)**: 전수조사가 아닌 표본조사에서 필연적으로 발생하는 오차 — 표본 크기 증가로 감소 - **비표본오차(Non-sampling Error)**: 표본추출과 무관한 오차 — 측정 오류·코딩 오류·비응답·자료 처리 실수 - 비표본오차는 표본을 키워도 줄어들지 않음 → 조사 설계·실행의 품질이 중요 ### 층화추출의 할당 방법 - **비례 할당(Proportionate Allocation)**: 모집단 비율과 동일하게 층별 표본 크기 결정 - nₕ = n × (Nₕ/N) - **비비례 할당(Disproportionate Allocation)**: 층별 표본 크기를 다르게 (분산·중요도 고려) - **등 할당(Equal Allocation)**: 모든 층에 동일한 표본 크기 - **Neyman Allocation**: 층별 분산을 고려한 최적 할당 — nₕ ∝ Nₕ·σₕ ### 표본추출 명칭 변형 - **단순 무작위 추출 / 단순임의추출(Simple Random Sampling)**: 모두 동일 — 모든 원소가 동등한 추출 확률 - **계통 추출 / 계통추출(Systematic Sampling)**: 일정 간격으로 추출 - **층화 추출 / 층화추출(Stratified Sampling)**: 동질적 층으로 나누고 각 층에서 무작위 - **집락/군집 추출 / 집락추출 / 군집추출(Cluster Sampling)**: 집락 단위로 추출 - ADsP 시험에서는 두 가지 표기가 모두 사용됨 — 동일 개념으로 인식 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **K-겹 교차검증** — 데이터를 K개 폴드로 나눠 K번 학습·평가 후 평균. K=5 또는 10이 일반적 - **계층적 K-겹** — 각 폴드에 클래스 비율을 유지 — 불균형 데이터에 권장 - **Leave-one-out** — K = n인 극단적 K-fold. 정확하나 계산 비용 큼(n번 학습) - **부트스트랩 vs 교차검증** — 부트스트랩은 복원추출, K-fold는 비복원 분할 - **단순임의추출** — 모든 원소가 동일한 확률로 추출 — 가장 기본 - **비복원 vs 복원** — 추출된 표본을 다시 모집단에 넣는지 여부 - **언더샘플링** — 다수 클래스를 일부만 선택하여 줄임 (예: Tomek Links·ENN) - **SMOTE-ENN / SMOTETomek** — 합성 + 정제를 결합한 하이브리드 기법 - **판단추출** — 연구자의 판단으로 대표성 있다고 판단되는 표본 선택 - **할당추출** — 모집단의 비율과 동일하게 할당 (예: 성별·연령별 비율) - **표본 비율의 분포** — 큰 표본에서 N(p, p(1−p)/n)으로 근사 (CLT) - **선택 편향** — 비무작위 표본 추출로 인한 체계적 편향 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 가설검정과 유의성 판단 URL: https://adsp.todaycode.kr/study/25 태그: 빅데이터 3V/5V, 기술통계, 확률분포, 가설검정, 비모수 검정, 점추정·구간추정, t검정 가설검정은 데이터를 이용하여 어떤 주장(가설)이 타당한지를 통계적으로 판단하는 절차입니다. 검정에는 두 가지 가설을 세웁니다. **귀무가설(H₀)**은 "효과가 없다" 또는 "차이가 없다"는 현재 상태를 지지하는 가설이고, **대립가설(H₁)**은 "효과가 있다" 또는 "차이가 있다"는 새로운 주장입니다. **p-value(유의확률)**는 귀무가설이 참이라고 가정했을 때, 현재 관측된 결과 이상으로 극단적인 결과가 나올 확률입니다. p-value가 작을수록 귀무가설이 참일 가능성이 낮으므로, 대립가설을 지지하는 증거가 됩니다. p-value가 유의수준(α, 보통 0.05)보다 작으면 귀무가설을 기각하고 대립가설을 채택합니다. 시험에서 "p-value가 유의수준보다 작으면 대립가설을 기각한다"는 보기가 나오면 반대이므로 틀린 것입니다. **제1종 오류(α 오류)**는 귀무가설이 실제로 참인데도 기각하는 오류입니다. 즉 효과가 없는데 있다고 잘못 판단하는 것입니다. **유의수준(α)**은 이 오류의 최대 허용 한계입니다. 시험에서 "유의수준은 제1종 오류의 최소 허용 한계"라고 하면 틀린 것입니다. 최소가 아니라 최대입니다. **제2종 오류(β 오류)**는 대립가설이 실제로 참인데 귀무가설을 기각하지 못하는 오류입니다. 유의수준을 너무 작게 설정하면 제2종 오류를 범할 확률이 높아지는 트레이드오프 관계가 있습니다. **검정력(Power) = 1 - β**로, 대립가설이 참일 때 귀무가설을 올바르게 기각하는 확률입니다. 검정력이 높을수록 실제 효과를 놓치지 않고 잡아낼 수 있으며, 표본 크기가 클수록 검정력이 높아집니다. 비모수 검정은 데이터가 특정 분포를 따른다는 가정 없이 수행하는 검정으로, 윌콕슨 순위합 검정, 만-휘트니 검정, run 검정 등이 있습니다. t-검정은 정규분포를 가정하는 모수 검정이므로 비모수 검정에 해당하지 않습니다. **신뢰구간(Confidence Interval)**은 모수를 특정 확률로 포함하는 구간을 추정하는 방법입니다. 95% 신뢰구간이란 "동일한 방법으로 표본 추출을 100번 반복하면 그 중 약 95번은 모수를 포함하는 구간이 만들어진다"는 의미입니다. "모수가 95% 확률로 신뢰구간 안에 있다"는 표현은 엄밀하게 틀린 해석입니다. 신뢰수준을 높이면 신뢰구간의 폭이 **넓어지고**, 표본 크기를 늘리면 신뢰구간의 폭이 **좁아집니다**. --- --- ## 분산분석(ANOVA, Analysis of Variance) **3개 이상 집단의 평균 차이**를 검정하는 방법입니다. t-검정은 두 집단만 비교 가능하지만 ANOVA는 다집단 비교가 가능합니다. | 종류 | 요인 수 | 예시 | |------|--------|------| | **일원분산분석(One-way)** | 1개 | 학원별 점수 차이 | | **이원분산분석(Two-way)** | 2개 | 학원×성별 점수 차이 | | **반복측정 ANOVA** | 동일 대상 반복 | 약물 투여 전후 | ### F 통계량 F = 집단 간 분산(MSB) / 집단 내 분산(MSW) - F가 클수록 집단 간 차이가 큼 → 귀무가설(평균 동일) 기각 - 귀무가설 H₀: μ₁ = μ₂ = ... = μk - 대립가설 H₁: 적어도 하나의 평균은 다름 ### 사후검정(Post-hoc Test) ANOVA로 "차이가 있다"는 결론이 나면, **어느 집단끼리 다른지** 추가 검정. - **Tukey HSD**: 가장 일반적, 모든 쌍을 비교 - **Bonferroni**: 다중비교 보정, 보수적 - **Scheffé**: 가장 보수적 ## 카이제곱 검정(Chi-Square Test) **범주형 변수**의 빈도 분석에 사용하는 비모수 검정입니다. | 종류 | 용도 | |------|------| | **적합도 검정** | 관측 빈도가 기대 분포에 맞는가? (예: 주사위 공정성) | | **독립성 검정** | 두 범주형 변수가 독립인가? (예: 성별과 흡연) | | **동질성 검정** | 여러 모집단의 분포가 같은가? (예: 지역별 선호도) | ### χ² 통계량 χ² = Σ (관측빈도 - 기대빈도)² / 기대빈도 - 분할표(Contingency Table) 기반 - 자유도: (행수-1) × (열수-1) - p-value < α → 독립이 아님(연관 있음) > **시험 포인트**: 3개 이상 집단 평균 비교 = ANOVA. 두 범주형 변수 연관성 = 카이제곱 독립성 검정. --- ## t-검정의 3가지 종류 | 종류 | 비교 대상 | 가정 | 예시 | |------|----------|------|------| | **단일표본 t검정** | 한 집단 평균 vs 기준값 | 정규성 | 우리 반 평균 점수 vs 전국 평균 | | **독립표본 t검정** (Independent) | 서로 다른 두 집단 평균 | 정규성, 등분산성 | 남학생 vs 여학생 점수 | | **대응표본 t검정** (Paired) | 동일 대상의 두 시점 측정 | 차이의 정규성 | 약물 투여 전·후 | ### 등분산성 위반 시 - **Welch t검정**: 등분산 가정 없이 사용 가능 - 등분산 검정: **F검정** 또는 **Levene 검정** ### 비모수 대안 | 모수 검정 | 비모수 대안 | |----------|------------| | 독립표본 t | **Mann-Whitney U** (윌콕슨 순위합) | | 대응표본 t | **Wilcoxon 부호순위** | | 일원 ANOVA | **Kruskal-Wallis** | > **시험 포인트**: 독립=서로 다른 집단, 대응=같은 대상의 전후. 정규성 가정 위반 시 비모수 검정으로 전환. --- ## 추가 핵심 개념 — 비모수 검정과 시계열 잔차 진단 - **모수 vs 비모수 검정**: - 모수(Parametric): 정규성·분산 등 모집단 분포 가정 — t검정·ANOVA·Z검정·F검정·Pearson - 비모수(Non-parametric): 분포 가정 불필요, 순위 기반 — Wilcoxon·Mann-Whitney·Kruskal-Wallis·Friedman·Chi-square·Spearman - **모수 ↔ 비모수 대응 매핑**: - 독립 표본 t-검정 → **만-휘트니 U(Mann-Whitney U)** 또는 윌콕슨 순위합 - 대응 표본 t-검정 → **윌콕슨 부호순위(Wilcoxon Signed-Rank)** - 일원 ANOVA → **크루스칼-월리스(Kruskal-Wallis)** - 반복측정 ANOVA → **프리드만(Friedman)** - 피어슨 상관 → **스피어만 ρ·켄달 τ** - **Ljung-Box 검정**: 시계열 잔차의 자기상관 0 검정. ARIMA·SARIMA 잔차가 백색잡음인지 확인하는 진단 도구. - **Cohen's Kappa**: 두 평가자(또는 두 분류 모델) 일치도 지표. 우연 일치를 보정. -1~1, 0.6 이상 양호. > **시험 핵심**: 모수↔비모수 대응 매핑은 시험 단골입니다. 표본이 작거나 정규성 위반이면 비모수를 선택하세요. ### 가설검정 핵심 용어 - **검정통계량(Test statistic)**: 표본으로부터 계산한 값(t, F, χ² 등). 귀무가설 하 분포와 비교 - **임계값(Critical value)**: 기각역의 경계점. 유의수준 α에 따라 결정 - **기각역(Rejection region)**: 검정통계량이 이 영역에 들어가면 H₀ 기각. 양측·단측 검정에 따라 달라짐 ### 모수적 검정 (분포 가정) - **t검정(t-test)**: 평균 비교 — 일표본·독립표본·대응표본 - **F검정(F-test)**: 분산비 비교, ANOVA의 핵심 통계량 - **카이제곱(χ²) 검정**: 적합도·독립성·동질성 - **일원분산분석(One-way ANOVA)**: 1개 요인의 ≥3개 그룹 평균 비교 - **이원분산분석(Two-way ANOVA)**: 2개 요인의 주효과와 교호작용 ### 비모수 검정 (분포 가정 없음) - **Wilcoxon 부호순위 검정**: 대응표본 t-검정의 비모수 대체 - **Mann-Whitney U 검정**: 독립표본 t-검정의 비모수 대체 - **Kruskal-Wallis 검정**: 일원분산분석의 비모수 대체 ### 정규성 검정 - **Shapiro-Wilk**: 표본 ≤ 5000에 권장, 가장 검정력 높음 - **Kolmogorov-Smirnov(K-S)**: 경험적 분포와 기준 분포의 최대 차이로 검정 - **QQ-Plot**: 분위수 비교 그래프, 직선에 가까울수록 정규 ### 검정력과 오류 종류 - **1종 오류(Type I, α)**: 귀무가설이 참인데 기각하는 오류 — 유의수준 - **2종 오류(Type II, β)**: 귀무가설이 거짓인데 기각하지 못하는 오류 - **검정력(Power, 1−β)**: 거짓 귀무가설을 정확히 기각할 확률 — 표본 크기·효과 크기와 비례 ### 다중비교 사후검정 - **Bonferroni 보정**: α / k (k = 비교 횟수) — 가장 보수적 - **Tukey HSD**: ANOVA 사후 짝비교에 흔히 사용 — 모든 쌍의 평균 차이 동시 비교 - **Scheffé 검정**: 어떤 선형결합 비교에도 사용 가능하나 보수적 - **다중비교 문제**: 동시에 여러 검정을 수행하면 α 인플레이션 발생 → 보정 필요 ### 가설 표기와 검정 방향 - **귀무가설(H₀, Null Hypothesis) / 영가설**: 기각하고자 하는 가설, 동일성·무효 가정 - **대립가설(H₁, Alternative Hypothesis)**: 입증하려는 가설 - **단측검정(One-tailed)**: 방향이 정해진 검정 (H₁: μ > μ₀ 또는 μ < μ₀) - **양측검정(Two-tailed)**: 방향 없이 다름만 검증 (H₁: μ ≠ μ₀) - **p-value(유의확률)**: 귀무가설이 참일 때 관측된 결과 또는 더 극단적 결과가 나올 확률. p < α이면 H₀ 기각 ### 표본분포 - **표본평균의 분포**: 모집단이 정규이면 표본평균도 정규. 모집단이 어떻든 n이 크면 CLT에 의해 정규 근사 - **표본비율의 분포**: np ≥ 5, n(1−p) ≥ 5이면 정규 근사 ### 표본 크기·효과 크기 - **표본 크기(Sample Size)**: 검정력·유의수준·효과 크기로부터 사전 결정 - **효과 크기(Effect Size)**: 그룹 간 차이의 크기 (Cohen's d, η², r) — 통계적 유의성과 별개의 실질적 의미 - **통계적 유의성 vs 실용적 유의성(Practical Significance)**: 표본이 크면 작은 차이도 유의해지므로 효과 크기로 실질 의미 평가 ### t-검정 종류 - **일표본 t-검정**: 표본평균이 특정 값과 같은지 - **독립표본 t-검정(Independent samples)**: 두 그룹의 평균 비교 - **대응표본 t-검정(Paired Sample)**: 사전·사후 등 짝지어진 자료의 평균 차이 검정 ### 추가 검정 - **ESD 검정(Extreme Studentized Deviate)**: 정규분포 자료의 다중 이상치 식별 - **F 검정량**: ANOVA에서 그룹 간 변동 / 그룹 내 변동 - **MSB(Mean Square Between, 그룹 간 평균제곱) / MSW(그룹 내 평균제곱)**: ANOVA의 분산 분해 ### 실험계획법 기본 - **일원배치(One-way ANOVA)**: 요인 1개의 수준별 평균 비교 - **이원배치(Two-way ANOVA)**: 요인 2개의 주효과와 교호작용 분석 - **반복측정 분산분석(Repeated Measures ANOVA)**: 같은 대상의 시점별 측정 비교 - **블록 설계 / 라틴 사각형**: 잡음을 통제하는 설계 기법 ### 등분산성 검정 - **Levene 검정**: 분산 동질성 검정 — 정규성 위배에도 강건 - **Bartlett 검정**: 분산 동질성 검정 — 정규분포 가정 필요 - **Welch's t-test**: 등분산을 가정하지 않는 t-검정 — Levene이 유의할 때 사용 ### 표준정규 임계값 표 - **양측 검정 임계값(z_{α/2})**: - α = 0.10 → ±1.645 - α = 0.05 → ±1.96 (가장 일반적) - α = 0.02 → ±2.326 - α = 0.01 → ±2.576 - **단측 검정 임계값(z_α)**: - α = 0.10 → ±1.282 - α = 0.05 → ±1.645 - α = 0.025 → ±1.96 - α = 0.01 → ±2.326 - **t 분포 임계값**: 자유도(df = n−1)에 따라 다름, 표본이 크면 정규에 수렴 ### 비모수 검정 추가 - **부호 검정(Sign Test)**: 대응 표본의 차이 부호(+/−)만으로 검정 — 분포 가정 없음 - **런 검정(Runs Test)**: 무작위성(Randomness) 검정 — 1-0 또는 +/− 수열에서 연속된 같은 값의 묶음(run) 수를 통계량으로 ### 검정 절차 표준 6단계 1. **귀무가설(H₀)·대립가설(H₁) 설정** 2. **유의수준(α) 결정** — 보통 0.05 3. **검정통계량 선택** — t·z·F·χ² 등 가설과 분포에 따라 4. **임계값(기각값) 결정** — α와 검정 종류로 결정 5. **검정통계량 계산 후 임계값과 비교** (또는 p-value < α 확인) 6. **결론 도출** — H₀ 기각 또는 기각 실패 ### 검정통계량의 분포 - **표본평균** → 정규분포 또는 t-분포 - **표본분산** → (n−1)s²/σ² ~ χ²(n−1) - **두 표본 분산비** → F(n₁−1, n₂−1) - **표본비율** → 큰 표본에서 정규 근사 - **검정통계량의 분포**를 알아야 임계값 결정과 p-value 계산 가능 ### Fisher's Exact Test - **Fisher's Exact Test(피셔 정확검정)**: 2×2 분할표에서 두 그룹의 비율 차이 검정 - 표본이 작거나 기대빈도가 5 미만이어서 카이제곱 근사가 부적절할 때 사용 - 모든 가능한 분할표를 정확히 계산 → "정확검정(Exact Test)" ### McNemar 검정 - **McNemar 검정**: 짝지어진 이진 자료의 비율 차이 검정 (사전-사후·두 분류기 비교) - 2×2 분할표에서 b·c(불일치 쌍)만 사용 - 머신러닝 모델 비교에 활용 ### Cochran's Q 검정 - **Cochran's Q**: 3개 이상의 짝지어진 이진 변수 비교 — McNemar의 일반화 ### 검정 영역 용어 - **임계영역(Critical Region) / 기각 영역(Rejection Region)**: 검정통계량이 들어가면 H₀ 기각하는 영역 - **수용 영역(Acceptance Region) / 비기각 영역**: H₀를 기각하지 못하는 영역 (참고: '수용'은 부적절한 용어, '기각 실패'가 정확) - **임계값(Critical Value)**: 기각 영역의 경계점 ### 신뢰구간 추가 용어 - **신뢰계수(Confidence Coefficient)**: 1 − α — 신뢰수준 - **신뢰한계(Confidence Limit)**: 신뢰구간의 상한·하한 - **신뢰구간의 폭**: 표본 크기 ↑·신뢰수준 ↓ → 폭이 줄어듦 ### 카이제곱(χ²) 검정 3종 - **카이제곱 통계량(Chi-square Statistic)**: χ² = Σ(O − E)² / E - O: 관측 빈도(Observed) - E: 기대 빈도(Expected) - 값이 클수록 관측과 기대의 차이가 큼 1. **적합도 검정(Goodness-of-Fit Test)**: 한 변수의 관측 분포가 기대 분포(예: 정규·균일)와 일치하는가 2. **독립성 검정(Independence Test)**: 두 범주형 변수가 서로 독립인가 (교차표·분할표 분석) 3. **동질성 검정(Homogeneity Test)**: 여러 그룹의 분포가 동일한가 ### 카이제곱 분포의 특성 - **자유도(df, Degrees of Freedom)**: 카이제곱 분포의 모양을 결정 - df 작으면 오른쪽 꼬리 길고, df 크면 정규 근사 - 적합도: df = k − 1 (k는 범주 수) - 독립성·동질성: df = (r−1)(c−1) (행·열 수) ### 정확 검정·보정 - **Fisher 정확 검정(Fisher's Exact Test)**: 표본이 작을 때(기대빈도 < 5) 카이제곱 대신 사용 — 초기하분포 기반 - **Yates 연속 보정(Yates' Continuity Correction)**: 2×2 표에서 카이제곱 검정의 연속성 보정 ### t-검정 종류 추가 - **일표본 t-test**: 표본평균 vs 특정 값 - **독립표본 t-test**: 두 독립 집단의 평균 비교 - **대응표본 t-test(Paired Sample t-Test)**: 같은 대상의 두 시점·두 조건 비교 (사전·사후) ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **기각역** — 검정통계량이 이 영역에 들어가면 H₀ 기각. 양측·단측 검정에 따라 달라짐 - **F검정** — 분산비 비교, ANOVA의 핵심 통계량 - **Shapiro-Wilk** — 표본 ≤ 5000에 권장, 가장 검정력 높음 - **Kolmogorov-Smirnov** — 경험적 분포와 기준 분포의 최대 차이로 검정 - **QQ-Plot** — 분위수 비교 그래프, 직선에 가까울수록 정규 - **Bonferroni 보정** — α / k (k = 비교 횟수) — 가장 보수적 - **Tukey HSD** — ANOVA 사후 짝비교에 흔히 사용 — 모든 쌍의 평균 차이 동시 비교 - **Scheffé 검정** — 어떤 선형결합 비교에도 사용 가능하나 보수적 - **표본비율의 분포** — np ≥ 5, n(1−p) ≥ 5이면 정규 근사 - **F 검정량** — ANOVA에서 그룹 간 변동 / 그룹 내 변동 - **Bartlett 검정** — 분산 동질성 검정 — 정규분포 가정 필요 - **t 분포 임계값** — 자유도(df = n−1)에 따라 다름, 표본이 크면 정규에 수렴 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 상관분석 URL: https://adsp.todaycode.kr/study/26 태그: 척도, 기술통계, 확률분포, 상관분석, 회귀분석, R 프로그래밍, 비모수 검정, 이상치·결측, 데이터 기반 의사결정, 점추정·구간추정 상관분석은 두 변수 사이의 직선적 관계의 강도와 방향을 측정하는 분석입니다. 상관계수는 -1에서 1 사이의 값을 가지며, **1에 가까울수록 강한 양의 상관관계**(한 변수가 증가하면 다른 변수도 증가), **-1에 가까울수록 강한 음의 상관관계**(한 변수가 증가하면 다른 변수는 감소), 0이면 직선적 상관관계가 없음을 의미합니다. 시험에서 "상관계수가 -1이면 상관관계가 가장 약하다"는 보기가 나오면 틀린 것입니다. -1은 완전한 음의 상관관계이므로 가장 강한 관계입니다. 아래 산점도 모음(위키미디어 Correlation_examples2)을 보면 세 줄로 상관계수의 본질을 한눈에 정리할 수 있습니다. **1행**은 r이 +1, 0.8, 0.4, 0, -0.4, -0.8, -1로 변하며 직선 관계의 강도와 방향이 어떻게 달라지는지를 보여 줍니다. **2행**은 모든 그림의 r이 0에 가깝지만 점들의 분산만 다른 형태로, 분산이 크다고 해서 상관이 약해지는 것이 아니라는 점을 알려 줍니다. **3행**은 곡선·V자·U자처럼 명확한 **비선형 패턴**이 존재하지만 피어슨 r이 0인 사례입니다. "r=0이면 두 변수 사이에 아무 관계가 없다"는 보기가 시험에 자주 등장하는데, 이는 **선형 관계만** 없을 뿐 비선형 관계는 있을 수 있으므로 틀린 설명입니다. **피어슨 상관계수**는 연속형 변수 간의 선형 관계를 측정할 때 사용합니다. 두 변수가 모두 정규분포를 따르고 선형 관계일 때 가장 적합합니다. **스피어만 상관계수**는 서열형(순위형) 변수 간의 관계를 분석할 때 사용하며, 비선형 관계도 어느 정도 파악할 수 있습니다. 시험에서 "스피어만은 범주형 변수의 선형 관계를 설명한다"는 보기가 나오면, 스피어만은 서열형 변수에 사용하고 비선형 관계도 분석 가능하므로 틀린 설명입니다. 또한 명목척도는 순서가 없으므로 스피어만 분석으로 분석할 수 없습니다. 상관분석에서 주의할 점은 **상관관계가 인과관계를 의미하지 않는다**는 것입니다. 또한 **켄달의 타우(Kendall's τ)**도 서열형 변수에 적합한 비모수 상관계수로, 스피어만 상관계수와 유사하나 일치쌍과 불일치쌍의 비율로 계산합니다. 피어슨 상관계수(r)의 제곱인 **결정계수(R²)**는 회귀분석에서 모형 설명력을 나타냅니다. 예를 들어 r=0.8이면 R²=0.64로, 독립변수가 종속변수 분산의 64%를 설명합니다. 스피어만 상관계수는 서열형(순위형) 데이터에 적합하며, 명목척도 변수에는 사용할 수 없습니다. 아이스크림 판매량과 익사 사고 건수가 높은 양의 상관관계를 보이지만, 이는 기온이라는 제3의 변수가 원인이지 아이스크림이 익사를 유발하는 것은 아닙니다. --- ## 핵심 요약 & 시험 포인트 ### 상관계수 종류 비교 | 종류 | 적용 척도 | 가정 | 특징 | |------|-----------|------|------| | **피어슨(Pearson)** | 등간·비율척도 | 정규분포, 선형 관계 | 모수 검정 | | **스피어만(Spearman)** | 서열·등간·비율척도 | 없음 (비모수) | 순위 기반, 단조 관계 | | **켄달의 타우(Kendall)** | 서열 이상 | 없음 (비모수) | 소규모 데이터에 강인 | ### 상관계수 해석 | 범위 | 해석 | |------|------| | **\|r\| = 1** | 완전한 선형 관계 | | **0.7 ≤ \|r\| < 1** | 강한 상관관계 | | **0.3 ≤ \|r\| < 0.7** | 중간 상관관계 | | **\|r\| < 0.3** | 약한 상관관계 | | **r = 0** | 선형 관계 없음 | > **시험 포인트:** 상관관계 ≠ 인과관계. 높은 상관이어도 인과관계는 별도 판단 필요. 피어슨 r의 제곱 = R² (결정계수). 명목척도에는 스피어만 사용 불가. --- --- ## 상관계수 종류 비교 | 상관계수 | 데이터 유형 | 관계 유형 | 가정 | |---------|-----------|---------|------| | **Pearson** | 연속형 (등간/비율) | **선형** 관계 | 정규성, 등분산성 | | **Spearman** | 순서형 또는 연속형 | **단조(monotonic)** 관계 | 비모수 | | **Kendall (τ)** | 순서형 | 단조 관계 | 비모수, 작은 표본에 강건 | ### 편상관계수(Partial Correlation) - 두 변수의 상관에서 **다른 변수의 영향을 통제(고정)** 한 후의 순수 상관 - 예: 키-시험 점수 상관에서 "나이" 영향 제거 후 분석 ### 상관계수 해석 - |r| ≥ 0.7: 강한 상관 - 0.3 ≤ |r| < 0.7: 중간 - |r| < 0.3: 약한 상관 - r = 0: 선형 관계 없음 (단, 비선형 관계는 있을 수 있음) > **시험 포인트**: Pearson은 선형, Spearman/Kendall은 단조. 비정규/이상치 → Spearman 사용. 인과관계 ≠ 상관관계. ### 표본 공분산 계산 - **표본 공분산**: Cov(X, Y) = Σ(xᵢ − x̄)(yᵢ − ȳ) / (n−1) - **표본의 평균(Sample Mean)**: x̄ = Σxᵢ / n - 공분산은 단위 영향을 받아 절대값 비교 어려움 → 상관계수로 표준화 권장 ### 상관계수 보조 지표 - **편의(Bias)**: 추정량과 실제 모수의 차이의 기댓값 - 표본 상관계수는 약간의 편의를 가지며 표본 크기가 커질수록 모상관에 수렴 ### 인과관계 vs 상관관계 - **상관관계(Correlation)**: 두 변수가 함께 변동 — 방향·강도만 측정 - **인과관계(Causality)**: 한 사건(원인)이 다른 사건(결과)을 발생시킴 — 방향성 + 메커니즘 - **"상관관계 ≠ 인과관계"**: 데이터 사이언스의 핵심 원칙 ### Mill의 인과 3원칙 (J.S. Mill) 1. **시간 우선성(Temporal Precedence)**: 원인이 결과보다 시간적으로 앞서야 함 2. **공변성(Covariation / 공변)**: 원인의 변동에 따라 결과도 변동해야 함 3. **다른 원인 배제(Non-spuriousness)**: 잠재변수 등 다른 설명을 통제해야 함 ### 가짜 관계 - **허위상관(Spurious Correlation) / 허위관계**: 제3의 잠재변수에 의한 가짜 상관 (예: 아이스크림 판매 vs 익사 사고 ← 여름) - **역인과(Reverse Causation)**: 인과의 방향이 반대 (예: 운동 → 건강이 아니라 건강 → 운동) - **잠재 변수(Latent Variable) / 잠복 변수**: 직접 관측 안 되나 결과에 영향 - **교란 변수(Confounding Variable) / 혼란 변수**: 원인·결과 모두에 영향을 미쳐 가짜 관계 만듦 ### 인과 추론 (Causal Inference) 기법 - **RCT(Randomized Controlled Trial, 무작위 통제 실험)**: 무작위 배정으로 처치·대조 집단을 만들고 효과 비교 — **인과 추론의 황금 표준(Gold Standard)** - **처치/처리 집단(Treatment Group)** vs **통제/대조 집단(Control Group)** - 의약품 임상시험·웹 A/B 테스트의 기본 - **도구변수(IV, Instrumental Variable)**: 처치와는 상관 있으나 결과에는 처치를 통해서만 영향 — 관측 불가 교란 완화 - **준실험(Quasi-Experiment) / 자연실험**: 무작위 배정 없이 실제 변동을 활용 - **이중차분법(DiD, Difference-in-Differences)**: 처치 전후·집단 간 차이의 차이로 효과 추정 - **회귀불연속 설계(RDD, Regression Discontinuity Design)**: 임계값 근처에서 처치 여부가 갈리는 상황 활용 - **성향 점수 매칭(Propensity Score Matching)**: 관측된 공변량 기반으로 비슷한 짝을 매칭 - **인과 그래프(DAG, Causal Diagram)**: 변수 간 인과 구조를 방향성 비순환 그래프로 표현 ### 효과의 정의 - **ATE(Average Treatment Effect, 평균 처치 효과)**: 모집단 전체의 평균 효과 - **CATE(Conditional ATE)**: 특정 부분집단의 조건부 효과 - **Selection Bias(선택 편향)**: 비무작위 배정으로 인한 효과 추정 편향 ### 일반화된 상관 측도 - **거리 상관(Distance Correlation)**: 두 변수의 비선형·고차원 의존성도 포착 - dCor = 0 ⇔ 두 변수가 독립 - 피어슨 상관과 달리 0이 독립을 함의 - **MIC(Maximal Information Coefficient)**: 정보이론 기반 비선형 상관 — 모든 함수형 관계 포착 ### 회귀의 이론적 기초 - **Gauss-Markov 정리**: 선형·등분산·무자기상관·기댓값 0인 잔차 가정 하에서 OLS가 BLUE ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **표본 공분산** — Cov(X, Y) = Σ(xᵢ − x̄)(yᵢ − ȳ) / (n−1) - **허위상관(Spurious Correlation) / 허위관계** — 제3의 잠재변수에 의한 가짜 상관 (예: 아이스크림 판매 vs 익사 사고 ← 여름) - **역인과** — 인과의 방향이 반대 (예: 운동 → 건강이 아니라 건강 → 운동) - **교란 변수(Confounding Variable) / 혼란 변수** — 원인·결과 모두에 영향을 미쳐 가짜 관계 만듦 - **처치/처리 집단** — vs **통제/대조 집단(Control Group)** - **도구변수** — 처치와는 상관 있으나 결과에는 처치를 통해서만 영향 — 관측 불가 교란 완화 - **이중차분법** — 처치 전후·집단 간 차이의 차이로 효과 추정 - **성향 점수 매칭** — 관측된 공변량 기반으로 비슷한 짝을 매칭 - **Selection Bias** — 비무작위 배정으로 인한 효과 추정 편향 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 회귀분석 URL: https://adsp.todaycode.kr/study/27 태그: 기술통계, 확률분포, 회귀분석, 로지스틱 회귀, 시계열 분석, 군집분석, 데이터 전처리, 변수 선택, 데이터 기반 의사결정, 데이터 웨어하우스, 점추정·구간추정, 모델 선택 기준 회귀분석은 하나 이상의 독립변수(원인)가 종속변수(결과)에 미치는 영향을 분석하는 방법입니다. 독립변수가 하나이면 단순회귀분석, 여러 개이면 다중회귀분석이라 합니다. 선형회귀의 본질은 "X 값마다 Y가 어떤 분포를 따르는데, 그 분포의 평균이 직선을 이룬다"는 확률적 가정입니다. 아래 위키미디어 그림(Normdist_regression)에서 회귀직선 위에 X마다 작은 정규분포 종 모양이 얹혀 있는 모습이 바로 이 의미입니다 — 각 X에서의 **조건부 기댓값 E[Y|X]을 잇는 직선**이 곧 회귀선이며, 관측값에서 회귀선까지의 거리(잔차)는 평균 0인 정규 오차로 가정됩니다. 이 가정이 선형성·등분산성·정규성·독립성이라는 4대 가정의 기하학적 토대입니다. 선형 회귀의 기본 가정은 네 가지입니다. 선형성(독립변수와 종속변수 간에 선형 관계 존재), 독립성(잔차들이 서로 독립), 등분산성(모든 독립변수 값에 대해 잔차의 분산이 동일), 정규성(잔차가 정규분포를 따름)입니다. **결정계수(R²)**는 회귀모형이 데이터를 얼마나 잘 설명하는지를 나타내며, SSR(회귀제곱합)/SST(총제곱합)=SSR/(SSR+SSE)로 계산합니다. 아래 위키미디어 그림(Coefficient_of_Determination)을 보면 R²의 기하학적 의미가 명확합니다. 데이터의 평균선 ȳ을 기준으로 한 **전체 분산(SST)** 이 두 부분으로 분해됩니다: 회귀선이 평균선으로부터 벌어진 만큼인 **설명된 분산(SSR — 빨간색 화살표)** 과, 관측값이 회귀선에서 벗어난 만큼인 **잔차 분산(SSE — 회색 화살표)** 입니다. R² = SSR/SST는 "전체 변동 중 모형이 설명한 비율"이고, R² = 1 - SSE/SST는 "잔차 비율을 1에서 뺀 값"으로 같은 결과를 내며, R²이 1에 가까울수록 회귀선이 데이터 변동을 더 많이 설명합니다. **R² = 1 - SSE/SST**로도 표현됩니다. R²는 0~1 사이 값을 가지며 1에 가까울수록 설명력이 높습니다. 다중회귀에서 독립변수를 추가하면 R²는 항상 증가하므로, 변수 수를 고려한 **수정 결정계수(Adjusted R²)**를 사용합니다. 수정 결정계수 = 1 - (1-R²)×(n-1)/(n-k-1) 으로, 유의하지 않은 변수를 추가하면 오히려 감소합니다. SSE는 오차제곱합이고 SST=SSR+SSE입니다. **MSE(평균제곱오차)=SSE/(n-k-1)**이며, n은 표본 수, k는 독립변수 수입니다. 단순회귀(k=1)에서는 SSE/(n-2), 다중회귀(k>1)에서는 SSE/(n-k-1)이 됩니다. 분모 n-k-1은 자유도(Degrees of Freedom)로, 추정해야 할 파라미터 수(절편 1개 + 독립변수 k개)를 표본 수에서 뺀 값입니다. **다중공선성(Multicollinearity)**은 다중회귀분석에서 독립변수들 간에 강한 상관관계가 존재하여 회귀계수의 추정이 불안정해지는 문제입니다. **VIF(분산팽창인자)** 지표로 측정하며, 해결 방안으로는 상관관계가 높은 변수를 제거하거나, 라쏘(Lasso) 회귀, 릿지(Ridge) 회귀, 엘라스틱넷(Elastic Net) 회귀 등의 정규화 기법을 사용합니다. **릿지(Ridge/L2)**는 회귀계수의 크기를 작게 만들되 0으로 만들지 않아 모든 변수를 유지합니다. **라쏘(Lasso/L1)**는 일부 회귀계수를 정확히 0으로 만들어 자동으로 변수 선택 효과를 냅니다. **엘라스틱넷**은 릿지(L2)와 라쏘(L1)를 결합한 방법입니다. 로지스틱 회귀는 다중공선성을 해결하는 방법이 아닙니다. 변수 선택 방법으로는 **전진선택법**(변수를 하나씩 추가), **후진제거법**(모든 변수에서 하나씩 제거), 단계별 선택법(추가와 제거를 반복)이 있습니다. --- ## 핵심 요약 & 시험 포인트 ### 선형 회귀 기본 가정 (선·독·등·정) | 가정 | 의미 | |------|------| | **선형성** | 독립변수와 종속변수 간 선형 관계 | | **독립성** | 잔차들이 서로 독립 | | **등분산성** | 모든 X 값에서 잔차의 분산이 동일 | | **정규성** | 잔차가 정규분포를 따름 | ### 주요 계산 공식 | 지표 | 수식 | 의미 | |------|------|------| | **R²** | 1 - SSE/SST = SSR/SST | 0~1, 클수록 설명력 높음 | | **수정 R²** | 1-(1-R²)×(n-1)/(n-k-1) | 다중회귀에서 변수 수 보정 | | **MSE** | SSE/(n-k-1) | 평균제곱오차, k=독립변수 수 | ### 정규화 회귀 비교 | 기법 | 특징 | |------|------| | **Ridge(L2)** | 계수를 줄이되 0으로 만들지 않음 (변수 유지) | | **Lasso(L1)** | 일부 계수를 정확히 0으로 → 자동 변수 선택 | | **Elastic Net** | Ridge + Lasso 혼합 | > **시험 포인트:** 다중공선성 진단 = **VIF**. VIF > 10이면 심각한 다중공선성. 수정 결정계수는 유의하지 않은 변수 추가 시 **감소**할 수 있음. --- --- ## 회귀모형 변수 선택 기준 (정보 기준) 여러 모형 중 **설명력과 단순함의 균형**을 평가하는 지표. 작을수록 좋음. | 지표 | 수식 | 특징 | |------|------|------| | **AIC** | -2 log(L) + 2k | Akaike. 일반적, 예측 중심 | | **BIC** | -2 log(L) + k × log(n) | Bayesian. AIC보다 강한 페널티(표본 클수록), **간결한 모형** 선호 | | **Mallows Cp** | SSE/MSE - n + 2k | Cp가 변수 개수 k에 가까울수록 좋음 | | **Adjusted R²** | 1 - (1-R²)(n-1)/(n-k-1) | 클수록 좋음 | > L: 우도, k: 파라미터 수, n: 표본 크기 ### 변수 선택 알고리즘 - **전진선택(Forward)**: 빈 모형에서 변수를 하나씩 추가, 더 이상 개선이 없으면 종료 - **후진제거(Backward)**: 모든 변수에서 시작, 기여도가 낮은 변수를 하나씩 제거 - **단계별(Stepwise)**: 추가와 제거를 번갈아, 가장 안정적 > **시험 포인트**: AIC, BIC는 **작을수록** 좋은 모형. n이 커지면 BIC가 더 보수적(변수 적게 선택). --- ## 회귀모형 진단 — 잔차 분석 ### 4대 가정 검정 도구 | 가정 | 진단 방법 | 위반 시 패턴 | |------|----------|------------| | **선형성** | 잔차 vs 적합값 plot | 곡선 패턴 | | **등분산성** | 잔차 vs 적합값 plot | 깔때기(funnel) 모양 | | **정규성** | **Q-Q plot**, Shapiro-Wilk 검정 | 직선에서 벗어남 | | **독립성** | **더빈-왓슨(Durbin-Watson) 통계량** | 잔차 시계열 패턴 | ### 더빈-왓슨(DW) 통계량 해석 - 범위: 0 ~ 4 - **DW ≈ 2**: 자기상관 없음 (이상적) - **DW < 2**: 양의 자기상관 - **DW > 2**: 음의 자기상관 - **DW < 1 또는 > 3**: 심각한 자기상관 ### Q-Q Plot 해석 - 잔차의 분위수 vs 정규분포의 분위수 - 직선에 가까울수록 정규성 충족 - S자 형태 → 첨도 문제, 휘어짐 → 왜도 문제 ## 회귀 종류 정리 | 회귀 | 종속변수 | 사용처 | |------|---------|--------| | **단순회귀** | 연속형 | y = β₀ + β₁x | | **다중회귀** | 연속형 | y = β₀ + β₁x₁ + ... | | **다항회귀(Polynomial)** | 연속형, 비선형 곡선 | y = β₀ + β₁x + β₂x² | | **로지스틱 회귀** | 이진 범주 | 분류 (확률) | | **다중 로지스틱** | 다중 범주 | 다항 분류 | | **포아송 회귀(Poisson)** | 카운트 (음 아닌 정수) | 사고 건수, 방문 횟수 | > **시험 포인트**: 더빈-왓슨이 2 근처면 OK, 0이나 4에 가까울수록 자기상관 심각. 카운트 데이터에는 포아송 회귀. --- ## 추가 핵심 개념 — 조정 결정계수와 로지스틱 회귀 보강 - **조정 결정계수(Adjusted R²)** = 1 − (1−R²)(n−1)/(n−k−1) — 변수 수 k에 페널티 부여. 다중회귀에서 의미 없는 변수 추가에 따른 R² 자동 증가 문제를 보정. - **로짓(Logit) 변환**: ln(p/(1−p)) — 확률 p를 (−∞, ∞)로 매핑해 선형 모형화. 로지스틱 회귀의 핵심 변환. - **오즈비(Odds Ratio, OR) = exp(β)**: 설명변수 1단위 증가 시 오즈의 곱셈적 변화율. β>0 → OR>1 (오즈↑), β=0 → OR=1 (영향 없음), β<0 → OR<1 (오즈↓). > **시험 핵심**: 조정 R²의 페널티 의미, 로짓·오즈비 변환은 회귀 단원의 핵심 출제 포인트입니다. ### 다중공선성과 진단 - **다중공선성(Multicollinearity)**: 독립변수 간 강한 상관 — 회귀계수 추정이 불안정해지고 부호가 뒤바뀔 수 있음 - **분산팽창인수(VIF, Variance Inflation Factor)**: VIFⱼ = 1/(1 − Rⱼ²). VIF > 10이면 다중공선성 의심, > 5 주의 - **공차한계(Tolerance)**: 1/VIF — 0.1 미만이면 문제 - **상태지수(Condition Number)**: 30 이상이면 다중공선성 ### 잔차 진단 - **잔차분석(Residual Analysis)**: 잔차의 정규성·등분산성·독립성·선형성 확인 - **QQ-Plot**: 잔차 정규성 시각 진단 - **표준화 잔차(Standardized Residual)**: 잔차를 표준편차로 나눈 값, |z| > 2~3이면 이상치 의심 - **스튜던트화 잔차(Studentized Residual)**: 해당 관측치를 제외하고 추정한 표준편차로 표준화 - **쿡의 거리(Cook's Distance)**: 한 관측치가 회귀계수에 미치는 영향. > 4/n 또는 > 1 주의 - **지렛값(Leverage)**: 독립변수 공간에서의 극단값 정도. (p+1)/n의 2~3배 초과 시 주의 - **더빈왓슨(Durbin-Watson) 통계량**: 잔차의 자기상관 진단. 2 근처면 무자기상관, 0에 가까우면 양의 자기상관 ### 변수 선택법 - **전진선택법(Forward Selection)**: 절편만으로 시작 → 가장 유의한 변수를 하나씩 추가 - **후진제거법(Backward Elimination)**: 모든 변수로 시작 → 가장 덜 유의한 변수를 하나씩 제거 - **단계적 선택법(Stepwise Selection)**: 전진·후진을 결합 — 추가/제거를 반복하며 최적 모형 탐색 - **Mallow's Cp / AIC / BIC / 수정 결정계수**: 변수 선택 기준(모형 적합도 vs 복잡도) - **수정 결정계수(Adjusted R²)**: 변수 수가 늘어도 자동 증가하지 않도록 보정 ### 정규화 회귀 (Regularized Regression) - **Ridge 회귀**: L2 페널티 (λΣβ²). 계수를 0에 가깝게 축소하지만 0이 되지는 않음. 다중공선성 완화에 유리 - **Lasso 회귀**: L1 페널티 (λΣ|β|). 일부 계수를 정확히 0으로 만들어 변수 선택 효과 - **Elastic Net**: L1 + L2 페널티 결합. Lasso의 변수 선택 + Ridge의 안정성 ### 회귀에서의 범주형 처리 - **더미변수(Dummy Variable)**: 범주형 변수를 0/1 변수로 변환 (k개 범주 → k−1개 더미) - **참조 범주(Reference Category)**: 더미로 변환할 때 기준이 되는 범주, 계수는 참조 대비 효과 ### 회귀 모형 확장 - **다항회귀(Polynomial Regression)**: y = β₀ + β₁x + β₂x² + … — 비선형 관계를 다항식으로 표현(여전히 계수에는 선형) - **교호작용(Interaction Effect)**: x₁·x₂ 항을 추가해 변수 간 상호작용 모델링 - **주효과(Main Effect)**: 개별 변수의 단독 효과 - **공변량(Covariate)**: 결과에 영향을 줄 수 있으나 주관심 변수가 아닌 통제 변수 - **ANCOVA(공분산분석)**: ANOVA에 공변량을 추가해 그룹 간 차이를 더 정밀하게 비교 ### 일반화선형모형 (GLM) - **GLM(Generalized Linear Model)**: 선형회귀를 일반화 — 연결함수(link function)와 분포족(family)을 선택 - **로지스틱 회귀**: 종속변수가 이진(베르누이) — link: logit, 출력은 오즈비 - **포아송 회귀**: 종속변수가 계수(count) — link: log - **로짓(Logit)**: log(p/(1−p)) — 오즈의 로그 - **오즈(Odds)**: p/(1−p) — 성공 확률 대비 실패 확률 비율 - **오즈비(Odds Ratio)**: 두 그룹의 오즈 비율, 로지스틱 회귀계수의 exp(β) ### 최소제곱법 (OLS) - **OLS(Ordinary Least Squares, 최소제곱법)**: 잔차 제곱합(SSE)을 최소화하는 회귀계수 추정 방법 — 선형회귀의 기본 - **분산 분해**: SST = SSR + SSE - **SST(Total Sum of Squares)**: 전체 변동 Σ(yᵢ − ȳ)² - **SSR(Regression Sum of Squares)**: 회귀가 설명하는 변동 Σ(ŷᵢ − ȳ)² - **SSE(Error Sum of Squares, 잔차제곱합)**: 잔차의 변동 Σ(yᵢ − ŷᵢ)² - **R² = SSR / SST** ### 회귀의 4가지 가정 (LINE) - **선형성(Linearity)**: y와 x의 관계가 선형 — 잔차도로 확인 - **독립성(Independence)**: 잔차들이 서로 독립 — Durbin-Watson 검정 - **정규성(Normality)**: 잔차가 정규분포 — QQ-Plot·Shapiro-Wilk - **등분산성(Homoscedasticity)**: 잔차의 분산이 일정 — Breusch-Pagan 검정 - **이분산성(Heteroscedasticity)**: 등분산성 위반 → 가중최소제곱(WLS)·로그변환으로 처리 ### 계수 검정 - **회귀계수의 유의성**: t 검정 또는 p-value로 H₀: βⱼ = 0 검정 - **표준화 계수(Standardized Coefficient, 베타 계수)**: 변수의 단위 영향 제거 — 변수 간 상대적 중요도 비교 - **모형 적합도(Goodness of Fit)**: R²·Adj R²·AIC·BIC 종합 ### 회귀 구분 용어 - **단순회귀(Simple Regression)**: 독립변수 1개 - **다중회귀(Multiple Regression)**: 독립변수 ≥ 2개, 종속변수 1개 - **다변량 회귀(Multivariate Regression)**: 종속변수 ≥ 2개 (다중회귀와 구분) ### 회귀모형의 진단 추가 - **Breusch-Godfrey 검정**: 일반화된 자기상관 검정 (다중회귀에서도 사용 가능) - **회귀모형의 진단 절차**: 잔차도 → 정규성(QQ-Plot) → 등분산성(잔차 vs 적합값) → 독립성(Durbin-Watson) → 영향관측치(Cook's D) ### 결측치 회귀 대체 - **회귀 대체(Regression Imputation)**: 결측치를 회귀모형의 예측값으로 대체 — 분산 과소추정 문제 - **다중대체(MICE, Multiple Imputation by Chained Equations)**: 여러 차례 대체하여 분산 추정 보정 ### 회귀 모형 종류 정리 - **단순선형회귀(Simple Linear Regression)**: y = β₀ + β₁x + ε — 독립변수 1개 - **다중선형회귀(Multiple Linear Regression)**: y = β₀ + β₁x₁ + ... + βₚxₚ + ε — 독립변수 ≥ 2 - **다항회귀(Polynomial)**: 독립변수의 거듭제곱 항 추가 — 비선형 관계 모델링 ### 로지스틱 회귀 변형 - **이항 로지스틱(Binary Logistic)**: Y가 두 클래스 - **다항 로지스틱(Multinomial Logistic)**: Y가 3개 이상 명목형 클래스 - **순서형 로지스틱(Ordinal Logistic)**: Y가 순서를 갖는 범주 ### 변수 선택 추가 - **Best Subset Selection(최적 변수 부분집합)**: 가능한 모든 부분집합(2^p)을 평가해 최적 선택 — 변수 수가 많으면 계산 폭증 - **단계적 방법(전진/후진/Stepwise)**: Best Subset의 근사적 대안 ### 회귀 진단 추가 - **조건수(Condition Number)**: X'X 행렬의 최대/최소 고유값 비율의 제곱근. 30 이상이면 다중공선성 의심 - **DFBETAS / DFFITS**: 특정 관측치가 회귀계수·예측값에 미치는 영향 - **이상관측치(Influential Observation)**: 회귀결과를 크게 좌우하는 관측치 ### 회귀에서의 변수 명칭 - **독립 변수(Independent Variable) / 예측 변수(Predictor) / 설명 변수(Explanatory Variable) / 입력 변수**: x — 같은 의미의 다양한 이름 - **종속 변수(Dependent Variable) / 반응 변수(Response Variable) / 결과 변수(Outcome) / 출력 변수**: y - **타깃 변수(Target Variable)**: 머신러닝에서 y의 일반적 명칭 ### 회귀 기본 요소 - **절편(Intercept, β₀)**: x = 0일 때 y의 기대값 - **기울기(Slope, β₁)**: x가 1 증가할 때 y의 평균 변화량 - **회귀선(Regression Line)**: 최소제곱 추정으로 얻은 직선·곡면 - **최소제곱 추정량(Least Squares Estimator)**: 잔차 제곱합을 최소화하는 추정량 ### 잔차의 성질 - **잔차의 합 = 0**: OLS의 결과로 자동 만족 (절편 포함 시) - **잔차의 평균 = 0**: 잔차의 합이 0이므로 평균도 0 - **잔차의 분포**: 회귀 가정에서는 평균 0인 정규분포 — QQ-Plot으로 확인 ### 결정계수 추가 - **결정계수의 의미**: 모형이 설명하는 변동의 비율 — 0~1 - **수정 결정계수(Adjusted R², 조정 R²)**: 변수 수 증가에 따른 R² 자동 증가 보정 → 변수 비교·선택에 유용 ### 회귀 전체 모형 검정 (F-검정) - **F-통계량(F-statistic)**: 회귀 모형이 모든 변수를 사용해 의미 있게 설명하는가? - F = (SSR/p) / (SSE/(n−p−1)) = MSR / MSE - 귀무가설 H₀: β₁ = β₂ = ... = βₚ = 0 (모든 회귀계수 0) - F가 크고 p-value < α이면 H₀ 기각 → 모형이 유의함 - **회귀 F검정**: 단일 계수 t-검정과 달리 전체 모형의 유의성을 한 번에 평가 ### 회귀모형의 적합도 - **회귀모형의 적합도(Goodness of Fit)**: 모형이 데이터를 얼마나 잘 설명하는가 - 지표: R²·Adj R²·F-통계·잔차 분석·AIC·BIC·RMSE - R² 단독으로 적합도 판단은 위험 → 잔차 진단 동반 필수 ### 단계적 회귀 (Stepwise Regression) - **Stepwise Regression**: 변수를 한 번에 하나씩 추가·제거하며 최적 모형 탐색 - **전진 선택(Forward) + 후진 제거(Backward)**: 각 단계에서 추가·제거를 모두 고려 - 기준: AIC·BIC·F 통계량·수정 결정계수 - 장점: Best Subset(2^p)보다 계산 효율적 - 단점: 국소 최적, 다중 검정 문제 ### 다중 회귀 추가 - **단순 회귀(Simple Regression)** vs **다중 회귀(Multiple Regression)**: 독립변수 수 - **다중 회귀의 가정**: 선형성·독립성·정규성·등분산성 + 다중공선성 없음 ### 회귀 추가 기법 - **교호작용항(Interaction Term)**: x₁·x₂ 형태로 두 변수의 상호작용을 모델링 — 한 변수의 효과가 다른 변수에 의존 - **로짓 변환(Logit Transformation)**: log(p/(1−p)) — 확률을 무한 범위로 변환, 로지스틱 회귀의 연결함수 - **데이터 중심화(Centering)**: x − x̄로 평균을 0으로 — 절편 해석 변경·교호작용 다중공선성 완화 - **Box-Cox 변환**: y의 거듭제곱·로그 변환으로 정규성·등분산성 확보 ### 정규화 회귀 추가 - **릿지 회귀(Ridge Regression) 추가**: L2 페널티 λΣβ² - 모든 계수 0에 가깝게 축소(0으로 가지는 않음) - 다중공선성 환경에서 안정적 - λ 선택: 교차검증 ### Mallow's Cp - **Mallow's Cp**: 모형 적합도 + 변수 수 페널티 — Cp ≈ p+1이면 좋은 모형 ### AIC와 BIC 비교 - **AIC(Akaike Information Criterion)**: 2k − 2·log(L) — k는 파라미터 수, L은 우도 - 작을수록 좋음 - 예측 성능을 우선 - **BIC(Bayesian Information Criterion)**: k·log(n) − 2·log(L) — n은 표본 크기 - 작을수록 좋음 - AIC보다 더 강한 페널티 → 단순 모형 선호 - 표본이 클수록 BIC가 단순 모형 선호 경향 - **활용**: 변수 선택·모델 비교·시계열 차수 결정 (ARIMA) - 일반적으로 AIC는 예측, BIC는 진실 모형 선택에 유리 ### Mallow's Cp 다시 - Cp = SSE/MSE_full − n + 2(p+1) - Cp ≈ p+1이면 좋은 모형 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **분산팽창인수** — VIFⱼ = 1/(1 − Rⱼ²). VIF > 10이면 다중공선성 의심, > 5 주의 - **잔차분석** — 잔차의 정규성·등분산성·독립성·선형성 확인 - **표준화 잔차** — 잔차를 표준편차로 나눈 값, |z| > 2~3이면 이상치 의심 - **스튜던트화 잔차** — 해당 관측치를 제외하고 추정한 표준편차로 표준화 - **쿡의 거리** — 한 관측치가 회귀계수에 미치는 영향. > 4/n 또는 > 1 주의 - **지렛값** — 독립변수 공간에서의 극단값 정도. (p+1)/n의 2~3배 초과 시 주의 - **더빈왓슨통계량** — 잔차의 자기상관 진단. 2 근처면 무자기상관, 0에 가까우면 양의 자기상관 - **Mallow's Cp / AIC / BIC / 수정 결정계수** — 변수 선택 기준(모형 적합도 vs 복잡도) - **R² = SSR / SST** — ### 회귀의 4가지 가정 (LINE) - **표준화 계수** — 변수의 단위 영향 제거 — 변수 간 상대적 중요도 비교 - **다변량 회귀** — 종속변수 ≥ 2개 (다중회귀와 구분) - **회귀모형의 진단 절차** — 잔차도 → 정규성(QQ-Plot) → 등분산성(잔차 vs 적합값) → 독립성(Durbin-Watson) → 영향관측치(Cook… - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 시계열 분석 URL: https://adsp.todaycode.kr/study/28 태그: 빅데이터 3V/5V, 기술통계, 가설검정, 시계열 분석, 변수 변환 시계열 분석은 시간의 흐름에 따라 관측된 데이터(시계열 데이터)를 분석하여 패턴을 파악하고 미래를 예측하는 방법입니다. 시계열 데이터는 네 가지 구성요소로 분해할 수 있습니다. **추세요인(Trend)**은 장기적으로 일정한 방향으로 상승 또는 하락하는 경향입니다. **계절요인(Seasonal)**은 일정한 주기를 가지고 반복되는 규칙적인 변동으로, 주기가 고정되어 있습니다. **순환요인(Cyclical)**은 경제 순환 등으로 인한 변동으로, 계절요인과 달리 주기가 고정되어 있지 않고 알려지지 않은 주기를 가집니다. 시험에서 "순환요인은 알려진 주기 또는 고정된 주기로 반복된다"는 보기가 나오면 이는 계절요인의 설명이므로 틀린 것입니다. **불규칙요인(Irregular)**은 위 세 가지 요인으로 설명할 수 없는 무작위 오차입니다. **정상 시계열**이란 시점에 무관하게 평균과 분산이 일정하고, 공분산이 시차(Lag)에만 의존하는(시점에는 의존하지 않는) 시계열을 말합니다. 비정상 시계열을 정상화하는 방법으로는 차분(데이터 간의 차이를 계산)과 변환(로그 변환 등)이 있습니다. 평균이 일정하지 않으면 차분을, 분산이 일정하지 않으면 변환을 사용합니다. 백색잡음(White Noise)은 평균 0, 일정한 분산을 가지며 자기상관이 없는 정상 시계열입니다. "백색잡음은 비정상 시계열"이라는 보기는 틀린 것입니다. **ARIMA(p,d,q) 모델**은 자기회귀(AR), 차분(I), 이동평균(MA)을 결합한 모델로, p는 자기회귀 차수, d는 차분 차수, q는 이동평균 차수입니다. 일반적으로 먼저 차분으로 정상성을 확보한 뒤 자기회귀와 이동평균 차수를 결정합니다. 정상성 검정 방법으로는 **ADF 검정(Augmented Dickey-Fuller Test)**이 대표적입니다. ADF 검정은 단위근(Unit Root) 존재 여부를 통계적으로 검정하여 시계열이 비정상인지 판단합니다. 귀무가설은 "단위근이 존재한다(비정상 시계열)"이며, p-value가 유의수준보다 작으면 귀무가설을 기각하여 정상 시계열로 판단합니다. **KPSS 검정**은 귀무가설이 "정상 시계열"로 ADF와 반대이므로 주의해야 합니다. KPSS에서 p-value < α이면 귀무가설(정상 시계열) 기각 → 비정상 시계열로 판단합니다. ADF는 p-value < α이면 귀무가설(비정상 시계열) 기각 → 정상 시계열로 판단하므로, 두 검정의 귀무가설이 반대임을 기억해야 합니다. --- --- ## 핵심 요약 & 시험 포인트 ### 시계열 구성요소 4가지 | 요인 | 특징 | |------|------| | **추세(Trend)** | 장기적 상승/하락 경향 | | **계절(Seasonal)** | 고정 주기 반복 변동 (주기 알려짐) | | **순환(Cyclical)** | 비고정 주기 변동 (주기 미상) | | **불규칙(Irregular)** | 무작위 오차 | > **시험 포인트:** "순환요인은 고정된 주기로 반복"은 **틀린 설명**입니다. 이것은 계절요인의 특징입니다. ### 정상성 확보 & 검정 | 구분 | 방법 | |------|------| | 평균이 비일정 | **차분(Differencing)** | | 분산이 비일정 | **로그 변환** 또는 Box-Cox 변환 | | 정상성 검정 | **ADF 검정** (귀무가설: 비정상, p<α → 정상) | > **시험 포인트:** 백색잡음(White Noise)은 **정상 시계열**입니다. "백색잡음은 비정상"이라는 보기는 틀립니다. ### ARIMA(p, d, q) - p: 자기회귀(AR) 차수 / d: 차분(I) 차수 / q: 이동평균(MA) 차수 --- --- ## 지수평활법 (Exponential Smoothing) **과거 관측값에 지수적으로 감소하는 가중치**를 부여해 예측하는 기법입니다. 최근 데이터에 더 큰 가중치. | 모형 | 적용 대상 | 평활상수 | |------|----------|---------| | **단순 지수평활** | 추세·계절 없는 시계열 | α (수준) | | **이중 지수평활(Holt)** | 추세 있음 | α(수준) + β(추세) | | **삼중 지수평활(Holt-Winters)** | 추세 + 계절 모두 | α + β + γ(계절) | > α 값이 클수록 최근 데이터에 더 큰 비중. α가 작으면 평활 효과↑ 안정성↑. ## ACF / PACF — ARIMA 모형 식별 | 함수 | 의미 | |------|------| | **ACF(자기상관함수)** | 시차 k에서의 자기상관 (간접 효과 포함) | | **PACF(편자기상관함수)** | 중간 시차의 효과를 제거한 순수 상관 | ### ARIMA(p,d,q) 식별 가이드 | 모형 | ACF | PACF | |------|-----|------| | **AR(p)** | 점진적 감소 (지수·사인) | **p시차 후 절단** | | **MA(q)** | **q시차 후 절단** | 점진적 감소 | | **ARMA(p,q)** | 점진적 감소 | 점진적 감소 | > **시험 포인트**: PACF가 절단되면 AR, ACF가 절단되면 MA, 둘 다 점진적 감소면 ARMA. ARIMA의 d는 정상화 차분 횟수. ## 시계열 분해 모형 — 가법 vs 승법 | 모형 | 수식 | 적용 | |------|------|------| | **가법모형(Additive)** | Yt = Tt + St + Ct + It | 계절 변동의 폭이 추세와 무관하게 **일정** | | **승법모형(Multiplicative)** | Yt = Tt × St × Ct × It | 계절 변동 폭이 추세에 **비례** | > 변동 폭이 시간에 따라 커지면 승법모형. 로그 변환 후 가법모형으로 다룰 수도 있음. --- ## Box-Cox 변환 (Power Transformation) 분산이 일정하지 않거나 비정규일 때 데이터를 변환하여 정상화하는 기법. ### 수식 - y(λ) = (y^λ - 1) / λ (λ ≠ 0) - y(λ) = log(y) (λ = 0) ### λ 값에 따른 변환 | λ | 변환 | 사용처 | |---|------|--------| | -1 | 1/y (역수) | 강한 우편향 | | -0.5 | 1/√y (역제곱근) | 중간 우편향 | | 0 | log(y) (로그) | 우편향, 분산 비례 평균 | | 0.5 | √y (제곱근) | 약한 우편향 | | 1 | y (변환 없음) | 정규에 가까움 | | 2 | y² (제곱) | 좌편향 | ### Box-Cox 사용법 1. 데이터에서 최적 λ를 **최대우도 추정**으로 결정 2. 결정된 λ로 변환 적용 3. 회귀·시계열 분석 진행 ### 제약과 대안 - **양의 값에만 적용 가능** (음수 시 사용 불가) - 음수 포함 데이터: **Yeo-Johnson 변환** 사용 > **시험 포인트**: 분산이 시간에 따라 커지는 시계열 → 로그(Box-Cox λ=0) 변환. λ를 데이터로부터 추정하므로 자동 변환 가능. --- ## 추가 핵심 개념 — 지수평활법·SARIMA·정상성 검정 - **지수평활법(Exponential Smoothing) 3종**: - 단순(SES, Simple): 추세·계절성 없는 시계열, 수준만 추정 - **Holt 이중(Double)**: 수준 + 추세 (계절성 없음) - **Holt-Winters 삼중(Triple)**: 수준 + 추세 + 계절 (가법 모형: 계절 폭 일정 / 승법 모형: 계절 폭이 추세에 비례) - **SARIMA(p, d, q)(P, D, Q)ₛ**: ARIMA에 계절성을 추가한 확장 모형. 소문자 = 비계절 차수, 대문자 = 계절 차수, s = 주기. - **Box-Cox 변환**: y(λ) = (y^λ−1)/λ (λ≠0), log(y) (λ=0). 분산 안정화·정규성 변환. y > 0 가정. 음수 포함 데이터에는 **Yeo-Johnson 변환** 사용. - **정상성 검정 — ADF vs KPSS**: - ADF(Augmented Dickey-Fuller): H₀ = 단위근 있음(비정상). p < α면 정상. - KPSS(Kwiatkowski-Phillips-Schmidt-Shin): H₀ = 정상. p < α면 비정상. - 둘 다 정상이라고 판정하면 가장 신뢰도 높음. > **시험 핵심**: 추세·계절성 유무에 따른 지수평활 선택, ADF·KPSS의 귀무가설 방향 차이가 시계열 단원의 핵심입니다. ### 시계열 핵심 진단 도구 - **ACF(자기상관함수, Autocorrelation Function)**: 시차 k의 자기상관 계수 — AR 차수 식별보다 MA 차수 식별에 사용 - **PACF(부분자기상관함수, Partial ACF)**: 중간 시차의 영향을 제거한 자기상관 — AR 차수 식별에 사용 - **백색잡음(White Noise)**: 평균 0, 일정한 분산, 무자기상관인 무작위 시계열 — 좋은 모형의 잔차는 백색잡음이어야 함 - **단위근(Unit Root)**: 시계열이 비정상성을 갖는 원인. ADF 검정으로 진단 - **확률보행(Random Walk)**: yₜ = yₜ₋₁ + εₜ. 단위근을 가지므로 차분이 필요 - **차분(Differencing)**: yₜ − yₜ₋₁ — 추세 제거. 1차 차분으로 부족하면 2차 차분 또는 계절 차분 ### 시계열 모형 계열 - **AR(p) 모형**: 자기회귀 — 과거 p개 시점의 선형결합 - **MA(q) 모형**: 이동평균 — 과거 q개 오차항의 선형결합 - **ARMA(p,q)**: AR + MA 결합 - **ARIMA(p,d,q)**: ARMA에 차분(d) 추가 — 비정상 시계열에 적용 - **SARIMA**: ARIMA에 계절 성분(P,D,Q,s) 추가 ### 지수평활법 - **단순 지수평활**: 수준만 모형화 - **Holt**: 수준 + 추세 - **Holt-Winters**: 수준 + 추세 + 계절 — 가법/승법 모델 ### 시계열 분해 (Decomposition) - **시계열 분해**: 시계열을 추세(T) + 계절(S) + 순환(C) + 불규칙(I) 성분으로 나누어 분석 - **가법 모형**: Y = T + S + C + I (계절 진폭이 일정할 때) - **승법 모형**: Y = T × S × C × I (계절 진폭이 추세에 비례할 때) - **STL(Seasonal-Trend decomposition using Loess)**: LOESS 평활을 활용한 강건한 분해 — 계절성 변화·이상치에 강함 - **고전적 분해**: 이동평균으로 추세 추정 → 잔차에서 계절성 추정 ### 평활 방법 - **이동평균법(Moving Average, MA)**: 일정 구간 평균으로 단기 변동 제거 - **단순 이동평균 / 가중 이동평균**: 모든 시점 동일 가중 vs 최근일수록 큰 가중 - **EWMA(Exponentially Weighted Moving Average)**: 가중치가 지수적으로 감쇠 — 지수평활과 동치 - **추세 분석(Trend Analysis)**: 장기 추세선 식별·외삽 ### 확률 과정 - **마르코프 체인(Markov Chain)**: 미래 상태가 현재 상태에만 의존 (마르코프 성질) - **MCMC(Markov Chain Monte Carlo)**: 마르코프 체인을 이용한 베이지안 추론의 핵심 알고리즘 — Gibbs·Metropolis-Hastings ### 정상성 (Stationarity) - **정상성(Stationarity)**: 시계열의 통계적 성질이 시간에 따라 변하지 않는 성질 - **약정상성(Weak Stationarity, 공분산정상성)**: 평균·분산·자기공분산이 시간에 무관 — 실무에서 보통 이 정의 사용 - **강정상성(Strong Stationarity)**: 모든 시점의 결합분포가 시간 이동에 불변 — 매우 강한 조건 - **단위근 검정(ADF·KPSS·PP)**: 정상성 진단 — 비정상이면 차분으로 정상화 ### 시계열의 4가지 변동 성분 - **추세변동(Trend)**: 장기적 증가·감소 경향 - **계절변동(Seasonality)**: 1년·1주 등 고정 주기의 반복 - **순환변동(Cycle)**: 주기가 일정하지 않은 장기 진동 (경기 사이클) - **불규칙변동(Irregular/Random)**: 설명되지 않는 잔여 변동 ### 시계열 분해 (Time Series Decomposition) 추가 - 분해의 목적: 각 성분을 분리해 추세·계절·주기·잡음을 이해하고 모형화 - **고전적 분해 vs STL vs X-13ARIMA-SEATS**: 점진적 정교화 ### 예측 오차 지표 - **예측 오차(Forecast Error)**: 실제값 − 예측값 - **MAPE(Mean Absolute Percentage Error)**: 100·Σ|오차/실제| / n — 단위 무관 - **RMSPE(Root MSE Percentage Error)**: √(Σ(오차/실제)² / n) × 100 - **SMAPE(Symmetric MAPE)**: 분모를 실제+예측의 평균으로 — 분모가 0에 가까운 문제 완화 ### 잔차 분석 - **잔차의 정상성·백색잡음 여부**: 좋은 시계열 모형의 잔차는 자기상관이 없어야 함 — Ljung-Box 검정 ### 정상성 검정 추가 - **ADF(Augmented Dickey-Fuller) 검정**: 단위근 존재 여부 — H₀: 단위근 있음(비정상) - **KPSS 검정**: H₀: 정상성 — ADF와 정반대 방향 - **Phillips-Perron 검정**: ADF의 변형, 이분산·자기상관에 강건 ### 지수평활법 계층 - **단순 지수평활(Simple Exponential Smoothing)**: 수준만 - **Holt 방법**: 수준 + 추세 - **Holt-Winters / Triple Exponential Smoothing**: 수준 + 추세 + 계절 ### 확장 모형 - **ARIMAX / SARIMAX**: 외생변수(Exogenous variable)를 포함한 ARIMA/SARIMA - **VAR(Vector Autoregression)**: 여러 시계열을 동시에 모형화 — 거시경제·금융에 사용 ### 모형 진단 - **Ljung-Box 검정**: 잔차의 자기상관 여부 — 백색잡음이어야 좋은 모형 ### 시계열 특성 추가 - **추세성(Trend)**: 시간에 따른 일관된 증가·감소 패턴 — 선형/비선형 - **주기성(Periodicity)**: 일정한 간격으로 반복되는 패턴 — 계절성과 구분 (계절은 주기가 1년 등 고정) - **시간 의존성(Temporal Dependence)**: 인접 시점 간 상관관계가 시계열의 본질 ### 장기 의존성 - **Long-term Dependency(장기 의존성)**: 멀리 떨어진 시점들 사이에 의존성이 존재 - RNN의 한계: vanishing gradient 때문에 장기 의존성 학습 곤란 - **LSTM·GRU·Transformer**: 장기 의존성 처리를 위해 등장한 구조 ### 지수평활 추가 변형 - **Brown's Single Exponential Smoothing(브라운 단순지수평활)**: 가장 기본 형태 - **Brown's Linear / Double Exponential Smoothing**: 추세 포함 - **Damped Trend(감쇠 추세)**: 미래 추세 효과를 점차 감소시킴 — 장기 예측에서 추세 폭주 방지 - **상태공간(State Space) 모형**: 지수평활을 통계적으로 일반화 — ETS(Error·Trend·Seasonal) ### 시계열 예측 평가 - **MAPE(Mean Absolute Percentage Error)**: 단위 무관, 0 근처 값에서 불안정 - **MASE(Mean Absolute Scaled Error)**: Naive 예측 대비 정규화 — 단위·스케일 무관 ### 시계열 데이터 분석 - **시계열 데이터 분석(Time Series Data Analysis)**: 시간 순서가 있는 데이터의 패턴·구조 분석 - 절차: 시각화 → 정상성 확인 → 모형 식별 → 적합·진단 → 예측·평가 - 활용: 매출 예측·주가 분석·날씨 예측·IoT 센서 모니터링 ### 자기회귀성 - **자기회귀성(Autoregressive Property)**: 현재 값이 과거 값에 의존하는 시계열 특성 - ACF·PACF로 진단 - AR(p) 모형은 자기회귀성을 명시적으로 모델링 ### 추세 제거 (Detrending) - **Detrending(추세 제거)**: 시계열에서 추세 성분을 제거해 정상성 확보 - 방법: - **차분(Differencing)**: 1차 차분 yₜ − yₜ₋₁, 2차 차분 - **회귀**: 시간을 독립변수로 회귀 후 잔차 - **이동평균 제거**: 이동평균을 빼서 단기 변동만 - **HP 필터(Hodrick-Prescott)**: 추세·순환을 분리하는 필터 ### 시계열 연산자 - **Backshift Operator(후행 연산자, B 또는 L)**: B·yₜ = yₜ₋₁ - **Lag Operator(시차 연산자)**: 동의어 - AR(1): yₜ = φ·yₜ₋₁ + εₜ → (1 − φB)yₜ = εₜ - ARMA·ARIMA 모형을 다항식 형태로 표현하는 데 사용 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **확률보행** — yₜ = yₜ₋₁ + εₜ. 단위근을 가지므로 차분이 필요 - **AR모형** — 자기회귀 — 과거 p개 시점의 선형결합 - **MA모형** — 이동평균 — 과거 q개 오차항의 선형결합 - **SARIMA** — ARIMA에 계절 성분(P,D,Q,s) 추가 - **가법 모형** — Y = T + S + C + I (계절 진폭이 일정할 때) - **승법 모형** — Y = T × S × C × I (계절 진폭이 추세에 비례할 때) - **고전적 분해** — 이동평균으로 추세 추정 → 잔차에서 계절성 추정 - **단순 이동평균 / 가중 이동평균** — 모든 시점 동일 가중 vs 최근일수록 큰 가중 - **RMSPE** — √(Σ(오차/실제)² / n) × 100 - **Phillips-Perron 검정** — ADF의 변형, 이분산·자기상관에 강건 - **ARIMAX / SARIMAX** — 외생변수(Exogenous variable)를 포함한 ARIMA/SARIMA - **시간 의존성** — 인접 시점 간 상관관계가 시계열의 본질 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 분류분석 — 의사결정나무·로지스틱 회귀·인공신경망 URL: https://adsp.todaycode.kr/study/29 태그: 기술통계, 확률분포, 로지스틱 회귀, 의사결정나무, 인공신경망, 모형 평가, 교차검증, 과적합, R 프로그래밍, 데이터 전처리, 텍스트 마이닝, 확률, 거리 측정, 활성화 함수, 강화학습·지도학습, 분류 임계값 분류분석은 이미 분류된(레이블이 있는) 데이터를 바탕으로 새로운 데이터가 어느 그룹에 속할지 예측하는 지도학습 방법입니다. 신용등급 예측, 스팸메일 분류, 질병 진단 등이 대표적 사례입니다. "아파트 가격 예측"은 연속형 수치를 예측하는 회귀 문제이므로 분류분석이 아닙니다. **의사결정나무(Decision Tree)**는 데이터를 특정 기준으로 반복적으로 분할하여 나무 형태의 구조를 만드는 방법입니다. 분할 기준으로 **지니지수(Gini Index)**나 **엔트로피(Entropy)**를 사용하며, 자식 마디의 순수도(한 범주의 비율)가 최대가 되도록 분류합니다. 지니지수는 1-Σ(Pᵢ²)로 계산하며, 값이 작을수록 순수합니다(CART 알고리즘 사용). 엔트로피는 -Σ(Pᵢ × log₂Pᵢ)로 계산하며, 값이 0에 가까울수록 순수하고 1에 가까울수록 불순합니다(C4.5 알고리즘 사용). **정보이득(Information Gain)**은 분기 전후의 엔트로피 감소량으로, 정보이득이 클수록 좋은 분할 기준입니다. **가지치기(Pruning)**는 과적합을 방지하기 위해 불필요한 가지를 제거하는 것으로, 학습 데이터에서의 정확도는 오히려 낮아질 수 있지만 일반화 성능은 향상됩니다. **로지스틱 회귀**는 종속변수가 범주형(예: 성공/실패, 합격/불합격)일 때 사용하는 분류 모델입니다. **시그모이드(Sigmoid) 함수**를 사용하여 출력값을 0과 1 사이로 변환합니다. 로지스틱 회귀에서 **오즈(Odds) = P(Y=1)/P(Y=0)**로, 사건이 발생할 확률을 발생하지 않을 확률로 나눈 비율입니다. 회귀계수 β의 **오즈비(Odds Ratio) = exp(β)**는 설명변수가 1단위 증가할 때 오즈가 변화하는 배율을 의미합니다. 오즈비가 1보다 크면 양의 영향(사건 발생 확률 증가), 1보다 작으면 음의 영향을 의미합니다. 즉 오즈는 "비율 자체"이고, 오즈비는 "X 변화에 따른 오즈의 증가 배율"입니다. **인공신경망(ANN)**은 인간 뇌의 뉴런 구조를 모방한 모델로, 입력층-은닉층-출력층으로 구성됩니다. 은닉층이 없으면 로지스틱 회귀와 동일하게 작동합니다. 활성화 함수로는 시그모이드(출력 0~1), ReLU(입력이 양수면 그대로, 음수면 0), 하이퍼볼릭 탄젠트(출력 -1~1), 소프트맥스(다중 클래스 분류 시 사용) 등이 있습니다. 가중치 개수는 (이전 층 노드 수 × 다음 층 노드 수)의 합으로 계산합니다. --- --- ## 핵심 요약 & 시험 포인트 ### 의사결정나무 분할 기준 비교 | 기준 | 수식 | 특징 | |------|------|------| | **지니지수** | 1-Σ(Pᵢ²) | 0에 가까울수록 순수, CART 알고리즘 | | **엔트로피** | -Σ(Pᵢ×log₂Pᵢ) | 0=완전 순수, 1=완전 불순, C4.5 알고리즘 | | **정보이득** | 분기 전 엔트로피 - 분기 후 엔트로피 | 클수록 좋은 분할 | > **시험 포인트:** 가지치기(Pruning)는 학습 데이터 정확도를 **낮추더라도** 일반화 성능을 높이는 것이 목적입니다. ### 오즈(Odds) vs 오즈비(Odds Ratio) | 개념 | 수식 | 의미 | |------|------|------| | **오즈(Odds)** | P(Y=1)/P(Y=0) | 발생 확률÷비발생 확률 | | **오즈비(Odds Ratio)** | exp(β) | X가 1단위 증가할 때 오즈가 변화하는 배율 | > **시험 포인트:** "설명변수가 1단위 증가할 때 오즈의 **증가율**"은 **오즈비(exp(β))**입니다. 오즈 자체가 아님에 주의! ### 활성화 함수 비교 | 함수 | 출력 범위 | 용도 | |------|-----------|------| | **시그모이드** | 0~1 | 이진 분류(출력층), 로지스틱 회귀와 동일 | | **ReLU** | 0 또는 입력값 | 은닉층 (기울기 소실 방지) | | **하이퍼볼릭 탄젠트** | -1~1 | 은닉층 | | **소프트맥스** | 합=1 | 다중 클래스 분류(출력층) | --- --- ## SVM (Support Vector Machine) **SVM**은 두 클래스를 분리하는 초평면(Hyperplane) 중 **마진(Margin)이 최대**가 되는 평면을 찾는 분류 기법입니다. > 💡 **한 줄 직관**: 두 그룹 사이에 **가장 넓은 도로**(마진)를 긋는다. 도로의 가장자리(갓길)에 정확히 닿는 점들이 **서포트 벡터(Support Vector)**, 도로의 한가운데를 지나는 가상의 선이 **초평면(Hyperplane)**. ### 핵심 4개념 (그림과 함께) | 개념 | 그림에서의 위치 | 한 줄 정의 | |------|----------------|----------| | **초평면(Hyperplane)** | 가운데 두꺼운 검은 선 (`w·x − b = 0`) | 두 그룹을 가르는 결정 경계 | | **마진(Margin)** | 두 점선 사이의 폭 (`2 / ‖w‖`) | 초평면과 가장 가까운 점까지의 거리 ×2 | | **서포트 벡터** | 점선 위에 동그라미로 표시된 점들 | 마진을 결정하는 경계점. 이 점들만 모델에 영향을 줌 | | **최대 마진** | SVM의 목표 | 마진을 최대화 = `‖w‖`를 최소화 | > 시험 포인트: **서포트 벡터가 아닌 점은 위치가 바뀌어도 결과가 바뀌지 않는다.** SVM은 "경계의 몇 점"만으로 결정되는 모델. ### 하드 마진 vs 소프트 마진 | 종류 | 오분류 허용 | 사용 상황 | |------|------------|----------| | **하드 마진(Hard Margin)** | 0개 | 데이터가 깔끔히 선형 분리 가능할 때 (현실에서 드묾) | | **소프트 마진(Soft Margin)** | 일부 허용 (슬랙 변수 ξ + 비용 C) | 노이즈·중첩이 있는 현실 데이터. **실제로 항상 이것을 사용** | - **C(비용 파라미터)**: 클수록 오분류에 엄격(과적합 ↑) / 작을수록 마진을 크게(일반화 ↑) ### 커널 트릭 (Kernel Trick) — 비선형 분리 > 💡 **직관**: 책상 위에 빨간 동전과 파란 동전이 섞여서 직선으로 못 가르겠다면? **책상을 흔들어 빨간 동전만 살짝 들어올린 뒤 그 사이를 손으로 가른다**. 차원을 한 단계 올리면 분리되지 않던 데이터도 평면 하나로 분리될 수 있다. 수학적으로는 원본 공간 → 고차원 특징 공간으로 매핑하지만, 실제로 매핑하지 않고 **내적만 계산**(트릭). ### 대표 커널 3종 | 커널 | 수식 | 사용 시점 | |------|------|----------| | **선형(Linear)** | K(x,y) = x·y | 데이터가 거의 선형 분리 가능, 변수 수 ≫ 데이터 수 | | **다항(Polynomial)** | K(x,y) = (x·y + c)^d | 변수 간 곱셈 형태의 상호작용 | | **RBF(Gaussian)** | K(x,y) = exp(−γ‖x−y‖²) | **기본값·가장 많이 사용**. 비선형 일반 데이터 | - **γ(감마)**: 클수록 결정 경계가 데이터를 촘촘히 감싸며 굽음(과적합 ↑) ### SVM 장단점 요약 | 장점 | 단점 | |------|------| | 고차원·복잡한 패턴에 강함 | 대용량 데이터에 느림 (O(n²)~O(n³)) | | 서포트 벡터 기반 → 메모리 효율적 | 확률값 출력이 기본 아님 (Platt scaling 필요) | | 커널로 비선형 문제 해결 | 변수 **스케일링 필수** (거리 기반) | | 일반화 성능 우수 | 커널·C·γ 등 **하이퍼파라미터 튜닝 부담** | > **시험 포인트 4가지** > 1. SVM의 목표 = **마진 최대화** > 2. 결과를 결정하는 것은 오직 **서포트 벡터** > 3. 비선형 분리는 **커널 트릭**으로 해결 > 4. **스케일링(표준화) 필수** — 거리 기반이라 변수 단위가 결과를 좌우함 ## 나이브 베이즈(Naive Bayes) **베이즈 정리**를 기반으로 모든 특성이 **조건부 독립**이라고 가정하고 분류하는 확률 모델입니다. P(C|X) ∝ P(C) × ∏ P(xᵢ|C) | 항목 | 설명 | |------|------| | **가정** | 특성들이 클래스 조건 하에 서로 독립 (현실에선 거의 X, 그래도 잘 동작) | | **장점** | 학습 속도 빠름, 적은 데이터로도 동작, 다중 클래스 | | **단점** | 독립 가정이 틀리면 성능 저하 | | **활용** | 스팸 필터, 문서 분류, 감성 분석 | | **라플라스 스무딩** | 학습 데이터에 없던 단어의 확률을 0으로 처리하지 않게 +1 보정 | ## KNN (K-Nearest Neighbors) **KNN**은 새로운 데이터의 클래스를 **가장 가까운 K개 이웃의 다수결**로 결정하는 거리 기반 분류 기법입니다. | 항목 | 설명 | |------|------| | **K 값** | 작으면 과적합(노이즈에 민감), 크면 과소적합 | | **거리 척도** | 유클리드, 맨하탄, 민코프스키 | | **게으른 학습** | 학습 단계 없음, 예측 시 전체 탐색 | | **표준화 필수** | 변수 스케일 차이가 거리에 영향 | > **시험 포인트**: KNN은 모델을 만들지 않고 데이터 자체를 "기억"합니다(Lazy Learning). 변수 정규화/표준화가 필수. ## 신경망 학습 — 순전파·역전파·경사하강법 | 단계 | 설명 | |------|------| | **순전파(Forward)** | 입력→은닉→출력층으로 값 전달, 손실 계산 | | **역전파(Backpropagation)** | 출력층→입력층으로 가중치별 기울기를 연쇄법칙으로 전달 | | **경사하강법(Gradient Descent)** | 기울기의 반대 방향으로 가중치 업데이트 | ### 경사하강법 변형 - **SGD**: 1개 샘플로 갱신, 빠르지만 불안정 - **Mini-batch GD**: 작은 배치 단위, 가장 일반적 - **Momentum**: 이전 갱신 방향 누적 - **Adam**: Momentum + RMSProp, 자주 사용 > **기울기 소실(Vanishing Gradient)**: 시그모이드/Tanh 사용 시 깊은 신경망에서 기울기가 0에 가까워지는 문제. ReLU 도입으로 완화됨. ## 의사결정나무 알고리즘 비교 | 알고리즘 | 분할 기준 | 입력 변수 | 분기 | |---------|----------|---------|------| | **ID3** | 정보이득 (엔트로피) | 범주형만 | 다지 | | **C4.5** | 정보이득비 | 범주형+연속형 | 다지 | | **CART** | 지니지수(분류) / 분산감소(회귀) | 범주형+연속형 | **이진** | | **CHAID** | 카이제곱 / F검정 | 범주형 | 다지 (통계적 유의성) | > **시험 포인트**: CART는 항상 이진 분기. CHAID는 통계 검정으로 유의한 분기만 수행. ID3는 범주형만 처리 가능. --- ## 의사결정나무 — 사전 가지치기 vs 사후 가지치기 | 종류 | 시점 | 방법 | 장단점 | |------|------|------|------| | **사전 가지치기 (Pre-pruning)** | 트리 성장 **중** | 정지 조건 설정 | 빠름, 너무 일찍 멈출 위험 | | **사후 가지치기 (Post-pruning)** | 완전 트리 생성 **후** | 가지 제거하며 검증 | 성능↑, 비용 큼 | ### 사전 가지치기 정지 조건 - **최대 깊이(max_depth)**: 트리 깊이 제한 - **최소 분할 샘플(min_samples_split)**: 분할에 필요한 최소 데이터 - **최소 리프 샘플(min_samples_leaf)**: 리프 노드 최소 데이터 - **최소 정보이득**: 분할의 정보이득 임계값 ### 사후 가지치기 방법 - **비용복잡도 가지치기 (Cost-Complexity Pruning, CCP)**: - α 파라미터로 모형의 복잡도(트리 크기) vs 정확도 trade-off 결정 - α↑ → 가지치기 강함 → 작은 트리 - 교차검증으로 최적 α 선택 - **Reduced Error Pruning**: 검증 세트로 가지 제거 시 성능 평가 > **시험 포인트**: 사후 가지치기가 일반적으로 더 좋은 성능. 사전은 계산이 빠르지만 너무 일찍 멈출 수 있음. 가지치기의 목적은 **과적합 방지·일반화 성능 향상**. --- ## 추가 핵심 개념 — 딥러닝 신경망 심화 - **활성화 함수 비교**: - **Sigmoid** σ(z) = 1/(1+e⁻ᶻ): [0,1], 이진 분류 출력층. 단점: 큰 |z|에서 기울기 소실 - **Tanh**: [-1,1], 0 중심으로 학습 안정성↑ - **ReLU** max(0, z): [0,∞), 은닉층 표준. 단점: 죽은 ReLU(Dying ReLU) - **Softmax**: 다중 분류 출력층(합=1로 정규화). 교차엔트로피 손실과 결합 - **학습 하이퍼파라미터**: - **학습률(Learning Rate, η)**: 너무 크면 발산, 너무 작으면 수렴 느림. Adam·RMSProp은 적응적 학습률 사용 - **드롭아웃(Dropout)**: 학습 시 뉴런 일부 무작위 비활성화(p=0.2~0.5)로 과적합 완화 - **배치 정규화(Batch Normalization)**: 각 층 입력의 분포를 정규화해 학습 가속·일반화 - **딥러닝 아키텍처**: - **CNN(Convolutional NN)**: 합성곱(Convolution) + 풀링(Pooling)으로 공간적 특징 추출. 이미지·영상 인식 - **RNN(Recurrent NN)**: 순환 구조로 시계열·텍스트 처리. 기울기 소실 문제 - **LSTM(Long Short-Term Memory)**: 셀 상태 + 3개 게이트(입력·망각·출력)로 RNN의 기울기 소실 해결. 장기 의존성 학습 가능 - **GRU(Gated Recurrent Unit)**: LSTM의 단순화 버전(2개 게이트) - **Transformer**: Attention 기반. 현재 NLP·시계열에서 RNN/LSTM 대체. BERT·GPT의 기반 - **Autoencoder**: 입력 → 인코더 → 잠재공간 → 디코더 → 입력 복원. 차원축소·이상탐지·생성 모델 - **GAN(Generative Adversarial Network)**: 생성자(Generator) vs 판별자(Discriminator)가 경쟁 학습. 이안 굿펠로우(2014) - **전이학습(Transfer Learning)**: 사전학습 모델(ImageNet·BERT)의 가중치를 새 도메인 데이터로 추가 학습(파인튜닝). 소규모 데이터에서도 효과적 - **k-NN(k-Nearest Neighbors)**: 게으른 학습(Lazy Learning) — 학습 단계에서 모델을 만들지 않고 예측 시 가장 가까운 k개 이웃의 다수결로 분류. 거리 기반이므로 정규화 필수. k가 작으면 과적합·노이즈 민감, k가 크면 과소적합 > **시험 핵심**: 활성화 함수별 출력 범위·용도, 드롭아웃·배치 정규화의 정규화 효과, CNN/RNN/LSTM/GRU/Transformer의 적용 영역은 딥러닝 단원의 빈출 포인트입니다. ### 인공신경망 심화 - **퍼셉트론(Perceptron)**: 신경망의 최소 단위. 입력 가중합 → 활성화 함수 - **은닉층(Hidden Layer) / 입력층 / 출력층**: 신경망의 3대 층 구성 - **활성화 함수(Activation Function)**: - **시그모이드(sigmoid)**: 0~1, 이진분류 출력층, gradient vanishing 문제 - **tanh**: −1~1, 시그모이드보다 학습 안정 - **ReLU**: max(0, x), 가장 널리 사용, gradient vanishing 완화 - **softmax**: 다중분류 출력층, 클래스 확률 합 = 1 - **역전파(Backpropagation)**: 출력에서 입력 방향으로 오차를 전파해 가중치 갱신 - **경사하강법(Gradient Descent)**: 손실함수 미분으로 가중치 업데이트 - **확률적 경사하강법(SGD)**: 미니배치 단위 경사하강 — 계산 빠르고 일반화 좋음 - **옵티마이저(Optimizer)**: Adam, RMSProp, AdaGrad 등. Adam이 가장 보편 - **드롭아웃(Dropout)**: 학습 시 일부 뉴런 무작위 비활성화 — 과적합 완화 - **배치 정규화(Batch Normalization)**: 층별 입력을 정규화해 학습 안정·가속 ### SVM (서포트 벡터 머신) - **마진(Margin)**: 결정경계와 가장 가까운 데이터(서포트 벡터) 사이 거리 — 마진을 최대화 - **커널(Kernel)**: 비선형 분류를 위해 데이터를 고차원으로 매핑하는 함수 - **선형(linear) / 다항(polynomial) / RBF(가우시안) / 시그모이드** - **C 파라미터**: 마진 위반 허용 정도 — 클수록 과적합, 작을수록 일반화 ### 분류 임계값(Threshold/Cutoff) - 로지스틱·확률 기반 분류기는 기본 0.5에서 결정 — 비용 불균형 시 조정 - 임계값을 낮추면 민감도(재현율)↑·특이도↓, 높이면 그 반대 ### 의사결정나무 알고리즘 계열 - **ID3 (Iterative Dichotomiser 3)**: 정보이득(Information Gain) 기준, 범주형 변수만 지원 - **C4.5**: ID3의 후속 — 이득률(Gain Ratio) 사용, 연속형·결측치 지원 - **C5.0**: C4.5 개선판 — 더 빠르고 메모리 효율적, 부스팅 내장 - **CART(Classification and Regression Tree)**: 지니지수(분류)·MSE(회귀) 기준, 이진 분할만 사용 - **CHAID(Chi-squared Automatic Interaction Detection)**: 카이제곱 검정으로 다중 분할 ### 학습 제어 - **조기 종료(Early Stopping)**: 검증 손실이 일정 횟수 개선되지 않으면 학습 중단 — 과적합 방지 - **학습률(Learning Rate)**: 가중치 갱신 보폭 — 너무 크면 발산, 너무 작으면 수렴 느림 - **에폭(Epoch)**: 전체 학습 데이터를 한 번 통과한 단위 - **배치 크기(Batch Size)**: 한 번의 가중치 갱신에 사용되는 표본 수 (1=SGD, 전체=배치 GD, 그 사이=미니배치) - **학습 곡선(Learning Curve)**: 학습량 대비 학습/검증 손실 — 편향·분산 진단 - **검증 곡선(Validation Curve)**: 하이퍼파라미터 값 대비 학습/검증 성능 ### 하이퍼파라미터 탐색 - **하이퍼파라미터(Hyperparameter)**: 학습 전에 사람이 정하는 모델 설정값 (학습률·트리 깊이·k 등) - **그리드 서치(Grid Search)**: 미리 정한 격자점을 모두 탐색 — 차원 저주 - **랜덤 서치(Random Search)**: 임의 샘플링 — 동일 시간 대비 그리드보다 우수한 경우 많음 - **베이지안 최적화(Bayesian Optimization)**: 이전 시도 결과로 다음 후보를 똑똑하게 선택 (Gaussian Process·TPE) ### 의사결정나무 분할 기준 - **지니불순도(Gini Impurity)**: 1 − Σpᵢ². 작을수록 순수. CART의 기본 - **엔트로피(Entropy)**: −Σpᵢ·log₂pᵢ. 정보이론 기반 - **정보획득(Information Gain)**: 분할 전 엔트로피 − 분할 후 가중 엔트로피 - **이득률(Gain Ratio)**: 정보획득을 분할정보(SplitInfo)로 정규화 — C4.5 ### 가지치기 (Pruning) - **사전 가지치기(Pre-pruning)**: 트리 성장 중 조기 중단 (최대 깊이·최소 샘플 등 제약) - **사후 가지치기(Post-pruning)**: 완전 성장 후 검증 성능이 떨어지는 가지 제거 — 비용복잡도 가지치기 ### 판별분석 (Discriminant Analysis) - **선형판별분석(LDA)**: 공통 공분산행렬 가정 → 선형 결정경계 - **이차판별분석(QDA)**: 각 클래스 공분산행렬이 다름 → 곡선 결정경계 — 더 유연하나 파라미터 많음 ### 분류 평가 추가 - **ROC Curve**: 임계값 변화에 따른 (1−특이도, 민감도) 궤적 - **임곗값(Cut-off)**: 확률을 양/음으로 가르는 기준값 - **오류율(Error Rate)**: (FP+FN)/전체 = 1 − Accuracy - **양성 예측도(PPV) = Precision**, **음성 예측도(NPV) = TN/(TN+FN)** ### 신경망 추가 - **MLP(Multi-Layer Perceptron, 다층 퍼셉트론)**: 1개 이상의 은닉층을 가진 피드포워드 신경망 — 비선형 분류·회귀의 기초 - **ELU / GELU**: 활성화 함수 변종 — ELU는 음수 영역에서 부드러운 곡선, GELU는 Gaussian 기반 (BERT·GPT 사용) - **Mini-Batch**: 학습 데이터를 작은 묶음(보통 32·64·128·256)으로 나눠 가중치 갱신 — SGD와 배치 GD의 절충 - **Saliency Map**: 입력 변수가 예측에 미친 영향을 시각화 — XAI 기법 ### 베이지안 네트워크 - **DAG(Directed Acyclic Graph, 방향 비순환 그래프)**: 베이지안 네트워크·인과추론의 기본 구조 ### 의사결정나무 용어 추가 - **단말 노드(Terminal Node) / 잎 노드(Leaf Node)**: 더 이상 분할되지 않는 최종 노드 - **분할정보(Split Information)**: 이득률 계산의 분모 ### 분류 문제 유형 - **이진 분류(Binary Classification)**: 두 클래스 (양성/음성) - **다항분류 / 다중 클래스(Multi-class Classification)**: 세 클래스 이상의 단일 라벨 - **다중 라벨(Multi-label)**: 한 샘플에 여러 라벨 - **OvR(One-vs-Rest) / OvA(One-vs-All)**: K개 클래스를 K개 이진 분류기로 분해 - **OvO(One-vs-One)**: 두 클래스씩 쌍별 이진 분류 → K(K−1)/2개 분류기 ### 불균형 데이터 처리 - **Imbalanced Data**: 클래스 비율이 크게 다른 데이터 — 정확도가 무의미해짐 - **양성 클래스(Positive Class) / 음성 클래스(Negative Class)**: 보통 관심 대상이 양성 (불량·사기·질환) - **기준선(Baseline) / 기준 모형(Naive Baseline)**: 최빈 클래스 예측·임의 추측 등 단순 기준 — 모델 성능 평가의 출발점 ### 신경망 학습 심화 - **역전파 알고리즘(Backpropagation)**: 출력층 오차를 입력 방향으로 전파해 모든 가중치의 기울기를 효율 계산 → 가중치 갱신 - **Vanishing Gradient(기울기 소실)**: 깊은 신경망에서 역전파 시 기울기가 0에 수렴 → 학습 정체 - 원인: sigmoid·tanh의 작은 미분값이 곱해지며 사라짐 - 해결: ReLU·잔차 연결(Residual)·LSTM·배치정규화 - **Exploding Gradient(기울기 폭주)**: 기울기가 발산 → 가중치 발산 - 해결: Gradient Clipping(기울기 절단) ### 가중치 초기화 - **Xavier 초기화 / Glorot 초기화**: 입력·출력 차원에 따른 정규분포 초기화 — sigmoid·tanh에 적합 - **He 초기화**: ReLU에 적합, 입력 차원 기반 - 0 초기화는 학습 불가(대칭성 문제), 너무 큰 값은 발산 ### 정규화 기법 (Regularization) - **L1 Regularization**: |w|의 합을 페널티 — 희소 해(일부 가중치 0) - **L2 Regularization / Weight Decay**: w²의 합을 페널티 — 매끄러운 작은 가중치 - **Elastic Net**: L1 + L2 결합 ### 비지도 신경망 - **오토인코더(Autoencoder)**: Encoder → 잠재공간 → Decoder, 입력 복원 — 차원축소·이상탐지·노이즈 제거 ### 의사결정나무 노드 구조 - **뿌리 노드(Root Node)**: 트리의 시작점 — 전체 데이터를 포함 - **내부 노드(Internal Node)**: 분기가 일어나는 중간 노드 - **잎/단말 노드(Leaf/Terminal Node)**: 더 이상 분할되지 않는 끝 노드 — 최종 예측값을 가짐 - **분기 변수(Split Variable) / 분기 기준(Splitting Criterion) / 분리 기준**: 노드를 나누는 변수와 그 임계값 - **복잡도(Complexity)**: 트리의 깊이·노드 수 — 과적합과 직결 ### 활성화 함수 추가 변종 - **Leaky ReLU**: x < 0에서 작은 기울기(α≈0.01) 유지 — Dying ReLU 문제 완화 - **Maxout**: 여러 선형 변환 중 최댓값 선택 — 활성화를 학습 - **Swish**: x · sigmoid(x) — ReLU보다 부드러움, 성능 우수 - **Mish**: x · tanh(softplus(x)) ### 옵티마이저 계보 - **SGD → Momentum → Nesterov → Adagrad → RMSProp → Adam → AdamW** - **Momentum(모멘텀)**: 이전 기울기를 누적 → 진동 감소·수렴 가속 - **Nesterov**: 모멘텀 적용 후의 위치에서 기울기 계산 - **Adagrad / Adadelta**: 변수별 학습률 자동 조정 - **RMSProp**: Adagrad의 학습률 감소 문제 완화 - **Adam**: Momentum + RMSProp 결합 — 가장 보편적 ### 순/역전파 - **순전파(Forward Propagation)**: 입력 → 출력 방향의 계산 - **역전파(Backpropagation, 역방향 패스)**: 출력 오차 → 입력 방향으로 기울기 전파 ### 손실 함수 추가 - **Huber Loss**: MAE와 MSE의 절충 — 작은 오차는 MSE, 큰 오차는 MAE, 이상치에 강건 - **Focal Loss**: 어려운 샘플에 집중하는 손실 — 불균형 데이터·객체 검출 ### Probit 회귀 - **Probit Regression**: 종속변수가 이진일 때 정규분포 누적함수를 연결함수로 사용 — 로지스틱과 유사하나 함수 형태 다름 ### 의사결정나무 알고리즘 — ID3 - **ID3(Iterative Dichotomiser 3)** by Quinlan 1986 - **분기 기준**: 정보획득(Information Gain) - **한계**: 연속형 변수·결측치 처리 부족, 다지 분기로 과적합 경향 - **C4.5**: ID3의 후속 — 이득률(Gain Ratio)·연속형·결측 지원 - **C5.0 / CART / CHAID**: 후속 진화 ### 신경망 발전사 - **단일 퍼셉트론(Single-layer Perceptron)**: 입력 → 출력 직접 연결 — Rosenblatt 1958 - **단일 퍼셉트론의 한계**: 선형 분리 가능한 문제만 학습 가능, **XOR 문제** 해결 불가 (Minsky & Papert 1969) - **다층 퍼셉트론(MLP)**: 은닉층 추가로 비선형 문제 해결 — XOR도 학습 가능 - **신경망의 학습**: 순전파로 예측 → 손실 계산 → 역전파로 기울기 → 옵티마이저로 가중치 갱신, 반복 ### CNN 구성요소 - **Feature Map(특성맵)**: 합성곱·풀링 후 만들어지는 중간 표현 — 입력의 특정 패턴을 강조 - **Filter(필터/커널)**: 합성곱에 사용되는 작은 행렬 — 학습되는 가중치 - **Stride**: 필터가 이동하는 간격 - **Padding**: 입출력 크기 조정을 위한 가장자리 채우기 - **Pooling**: Max/Average Pooling — 차원 축소·이동 불변성 ### RNN/LSTM 구성요소 - **Cell State**: LSTM의 장기 기억 — 시간을 통해 흐르며 정보 유지 - **Hidden State**: 단기 기억 / 출력 - **Gate**: Input/Forget/Output 게이트 — 정보의 흐름 제어 - **Input Gate**: 새 정보를 셀에 얼마나 추가할지 - **Forget Gate**: 기존 정보를 얼마나 잊을지 - **Output Gate**: 셀에서 얼마나 출력할지 ### 결정 임계값 (Decision Threshold) - **결정 임계값(Decision Threshold / Cut-off)**: 확률을 양/음 클래스로 가르는 기준값 (보통 0.5) - **임계값 ↓**: 더 많은 양성 예측 → Recall ↑, Precision ↓ (놓치면 안 되는 의료·암 진단) - **임계값 ↑**: 더 적은 양성 예측 → Precision ↑, Recall ↓ (거짓 양성 비용 큰 스팸·추천) - PR/ROC 곡선으로 임계값별 성능 시각화 → 비즈니스 목적에 맞춰 선택 ### 의사결정나무 핵심 하이퍼파라미터 - **max_depth**: 트리의 최대 깊이 — 클수록 복잡·과적합 - **min_samples_split**: 노드 분할에 필요한 최소 샘플 수 - **min_samples_leaf**: 잎 노드가 가져야 할 최소 샘플 수 - **max_leaf_nodes**: 최대 잎 노드 수 - **ccp_alpha(비용복잡도 가지치기 파라미터)**: 클수록 가지치기 강함 - 가지치기·최대 깊이 제한이 과적합 방지의 핵심 ### SVM 커널 종류 - **Linear SVM(선형 커널)**: 선형 분리 가능한 경우 — K(x, y) = x·y - **Polynomial SVM(다항 커널)**: K(x, y) = (γx·y + r)^d — 다항식 특성공간으로 매핑 - **RBF SVM(가우시안 커널)**: K(x, y) = exp(−γ‖x−y‖²) — 가장 보편적, 무한차원 매핑 - **Sigmoid SVM**: 신경망과 유사한 활성화 형태 ### 결정 함수와 영역 - **결정 함수(Decision Function)**: 모델이 출력하는 점수·확률 - **결정 영역(Decision Region)**: 같은 클래스로 분류되는 입력 공간의 영역 - **결정 경계(Decision Boundary)**: 클래스가 바뀌는 경계 ### 의사결정나무 규칙 - **분리규칙(Splitting Rule)**: 노드를 어떻게 나눌지 — Gini·Entropy·Gain Ratio - **정지규칙(Stopping Rule)**: 더 이상 분할하지 않는 조건 — 최소 샘플·최대 깊이·불순도 임계 - **정보이득률(Gain Ratio)**: 정보획득을 분할정보로 나눠 정규화 — C4.5에서 사용 - **지니 불순도(Gini Impurity, CART)**: 1−Σpᵢ² — CART의 기본 ### 비모수 모형 - **비모수 모형(Non-parametric Model)**: 모수의 수가 고정되지 않고 데이터 크기에 따라 증가 — KNN·의사결정나무·SVM(RBF)·신경망 ### 인공신경망 이론 - **Universal Approximation Theorem(근사 정리)**: 단일 은닉층 신경망도 충분한 뉴런이 있으면 임의의 연속함수를 근사 가능 — 신경망의 이론적 기초 ### CNN/DL 추가 개념 - **완전연결(Dense / Fully Connected) 층**: 이전 층의 모든 뉴런과 연결 - **데이터 증강(Data Augmentation)**: 회전·반전·노이즈 추가로 학습 데이터를 인공적으로 늘림 — 과적합 완화 - **사전학습(Pre-training)**: 대규모 일반 데이터로 먼저 학습 후 특정 과제에 전이 - **동결 해제(Gradual Unfreezing)**: 전이학습 시 사전학습 가중치를 단계적으로 학습 가능하게 풀어줌 - **Inverted Dropout**: 학습 시 활성화에 1/(1−p)를 곱해 추론 시 가중치 조정 불필요한 Dropout 변형 - **이미지 분할(Segmentation)**: 픽셀 단위로 영역을 분류 — U-Net·Mask R-CNN ### SOM의 창시자 - **Teuvo Kohonen(1982)**: 자기조직화지도(SOM, Kohonen Map)의 창시자 ### 로컬·전역 최적 - **Local Optimum(지역 최적)**: 주변보다는 좋지만 전체 최적이 아닌 해 - **Global Optimum(전역 최적)**: 모든 해 중 최적 - **Saddle Point(안장점)**: 한 방향으로는 최소, 다른 방향으로는 최대 — 신경망 학습에 자주 등장 ### 확률 보정 (Probability Calibration) - **확률 보정(Calibration)**: 모델이 출력하는 확률값이 실제 빈도와 일치하도록 조정 - **Platt Scaling**: 출력 점수에 로지스틱 회귀 적합 — SVM·트리 모델의 확률 보정에 사용 - **Isotonic Regression(아이소토닉 회귀)**: 단조 비감소 함수로 점수를 확률에 매핑 — 비모수 보정 - **Calibration Plot**: 예측 확률(x)과 실제 빈도(y) 비교 — 대각선에 가까울수록 잘 보정됨 - **Brier Score**: 보정도 종합 평가 지표 ### 임곗값 조정 - **Threshold Moving(임곗값 이동)**: 비용·불균형에 따라 결정 임계값을 0.5에서 다른 값으로 조정 - 불균형 데이터·비대칭 비용·도메인 요구사항에 맞춰 최적 임곗값 탐색 ### 단일 클래스 SVM - **One-Class SVM**: 한 클래스(정상)만 학습 → 이상 탐지에 활용 - 사기 탐지·고장 감지·침입 탐지에서 사용 — 양성 데이터만 존재하는 경우 ### Soft / Hard Margin - **Hard Margin SVM**: 모든 학습 데이터를 마진 밖에 두는 엄격한 분리 — 선형 분리 가능 데이터에만 - **Soft Margin SVM**: 일부 위반 허용, 슬랙 변수(여유 변수, ξ) 도입 - **C 파라미터**: 위반 페널티 — C ↑ → Hard, C ↓ → Soft (더 관대) ### XAI 시각화 기법 - **Grad-CAM(Gradient-weighted Class Activation Mapping)**: CNN의 마지막 합성곱 층의 그래디언트로 중요 영역 시각화 - **Saliency Map**: 입력 변수가 예측에 미친 영향의 절댓값을 시각화 - **Integrated Gradients**: 입력 경로를 따라 기울기를 적분 — 노이즈 적음 ### CAP Curve - **CAP(Cumulative Accuracy Profile) Curve**: 모델이 잡아내는 양성 누적 비율 - x축: 전체 데이터 중 선택 비율 - y축: 잡아낸 양성 누적 비율 - 완벽 모델 ↔ 무작위 모델 사이의 면적 비율(Accuracy Ratio)로 평가 ### 베이지안 네트워크 - **베이지안 네트워크(Bayesian Network) / BBN**: 변수 간 조건부 의존성을 DAG로 표현 - **Belief Network**: 베이지안 네트워크의 동의어 - 활용: 의료 진단·고장 진단·인과 추론 ### 메타휴리스틱 최적화 알고리즘 - **메타휴리스틱(Metaheuristic)**: 일반적인 최적화 문제를 해결하는 휴리스틱의 상위 개념 — 문제 특성에 의존하지 않는 범용 전략 - **유전 알고리즘(GA, Genetic Algorithm)**: 다윈의 자연선택을 모방한 진화 기반 최적화 — 존 홀랜드(John Holland, 1975) 개발 - 절차: 초기 해집단(Population) → 적합도(Fitness) 평가 → **선택(Selection)** → **교차(Crossover, 교배)** → **돌연변이(Mutation)** → 세대 반복 - **유전자(Gene) / 염색체(Chromosome)**: 해(solution)의 부호화 - **적자생존(Survival of the Fittest)** 원리 - **선택 방식**: 룰렛휠(Roulette Wheel), 토너먼트(Tournament), 순위 기반 - **입자 군집 최적화(PSO, Particle Swarm Optimization)**: 새 떼·물고기 떼의 군집 행동을 모방 — 입자들이 개인 최적과 군집 최적을 향해 이동 - **시뮬레이션 어닐링(Simulated Annealing, SA) / 담금질 기법**: 금속 담금질 과정 모방 — 온도를 점진적으로 낮추며 국소 최적 탈출 - **개미 군집 최적화(Ant Colony Optimization, ACO)**: 페로몬 trail을 통한 협력 탐색 - **타부 탐색(Tabu Search)**: 최근 방문 해를 금지 목록에 추가해 순환 방지 - **유전 프로그래밍(Genetic Programming, GP)**: GA를 프로그램·식 자체에 적용 ### 신경망 잔차 연결 - **Residual Connection(잔차 연결) / Skip Connection**: ResNet의 핵심 — 입력을 출력에 직접 더해줌 (y = F(x) + x) - **Highway Network**: 게이트가 잔차 연결을 동적으로 조절 - 효과: Vanishing Gradient 완화, 매우 깊은 네트워크 학습 가능 ### 강화학습 추가 알고리즘 - **SARSA(State-Action-Reward-State-Action)**: On-policy TD 학습 — 실제 다음 행동으로 업데이트 - **Q-Learning vs SARSA**: Off-policy(최대 Q값으로 업데이트) vs On-policy(실제 정책 행동으로 업데이트) - **On-policy / Off-policy**: 학습 정책과 행동 정책의 일치 여부 ### CNN 층 명칭 한글 - **컨볼루션층(Convolution Layer)**: 필터로 합성곱 — 특성 추출 - **풀링층(Pooling Layer)**: Max/Average Pooling — 차원 축소·이동 불변성 - **완전연결층(Fully Connected Layer)**: 모든 뉴런 연결 — 분류·회귀 출력 - **드롭아웃층(Dropout Layer)**: 학습 시 무작위 뉴런 비활성화 — 과적합 완화 - **배치 정규화층(Batch Normalization Layer)**: 층별 입력 정규화 — 학습 안정화·가속 ### 학습 가능 파라미터 - **학습 가능한 파라미터(Trainable / Learnable Parameter)**: 학습 과정에서 갱신되는 가중치·편향 - 예: CNN의 필터·완전연결층의 가중치·BN의 γ/β - **비학습 파라미터**: BN의 통계량(러닝 평균/분산) — 학습 중 누적되지만 기울기 갱신 안 됨 - 모델 크기는 보통 학습 가능 파라미터 수로 표현 (예: GPT-3 175B) ### 판별 모델 vs 생성 모델 - **Discriminative Model(판별 모델)**: P(Y|X) 직접 학습 — 로지스틱·SVM·신경망 - **Generative Model(생성 모델)**: P(X, Y) 또는 P(X) 학습 — 나이브 베이즈·GAN·VAE - 판별: 분류 성능 우수, 생성: 데이터 생성·이상 탐지 ### 베이즈 최적 분류기 - **Bayes Optimal Classifier**: 진짜 P(Y|X)를 안다고 가정할 때의 이론적 최적 분류기 - **Bayes Risk(베이즈 위험)**: 베이즈 최적 분류기의 오류율 — 도달 가능한 최저 오류율 - 실제 모델의 오류율 = Bayes Risk + 추정 오차 + 최적화 오차 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **softmax** — 다중분류 출력층, 클래스 확률 합 = 1 - **확률적 경사하강법** — 미니배치 단위 경사하강 — 계산 빠르고 일반화 좋음 - **옵티마이저** — Adam, RMSProp, AdaGrad 등. Adam이 가장 보편 - **배치 정규화** — 층별 입력을 정규화해 학습 안정·가속 - **C5.0** — C4.5 개선판 — 더 빠르고 메모리 효율적, 부스팅 내장 - **배치 크기** — 한 번의 가중치 갱신에 사용되는 표본 수 (1=SGD, 전체=배치 GD, 그 사이=미니배치) - **학습 곡선** — 학습량 대비 학습/검증 손실 — 편향·분산 진단 - **검증 곡선** — 하이퍼파라미터 값 대비 학습/검증 성능 - **오류율** — (FP+FN)/전체 = 1 − Accuracy - **양성 예측도= Precision** — , **음성 예측도(NPV) = TN/(TN+FN)** - **ELU / GELU** — 활성화 함수 변종 — ELU는 음수 영역에서 부드러운 곡선, GELU는 Gaussian 기반 (BERT·GPT 사용) - **OvR(One-vs-Rest) / OvA(One-vs-All)** — K개 클래스를 K개 이진 분류기로 분해 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 앙상블 기법 — 배깅·부스팅·랜덤포레스트 URL: https://adsp.todaycode.kr/study/30 태그: 데이터 유형, 분석 주제 유형, 기술통계, 회귀분석, 의사결정나무, 앙상블, 랜덤포레스트, 과적합, 데이터 전처리, 부트스트랩, 표본조사 앙상블(Ensemble)은 여러 개의 모델을 결합하여 하나의 더 강력한 예측 모델을 만드는 기법입니다. 단일 모델의 약점을 보완하여 전체적인 예측 성능을 향상시키는 것이 목적입니다. **배깅(Bagging, Bootstrap Aggregating)**은 복원추출 방식의 부트스트랩으로 여러 개의 훈련 데이터 세트를 만들고, 각각으로 독립적인 모델을 학습시킨 후 결과를 종합합니다. 분류 문제에서는 다수결 투표(Voting), 회귀 문제에서는 평균을 사용합니다. 각 모델이 독립적으로 **병렬 학습**되는 것이 특징입니다. **랜덤포레스트(Random Forest)**는 배깅을 기반으로 복수의 의사결정나무를 생성하고 예측을 종합하는 대표적인 앙상블 기법입니다. **부스팅(Boosting)**은 약한 학습기를 순차적으로 학습시키면서, **이전 모델이 잘못 분류한 데이터에 더 큰 가중치를 부여**하여 다음 모델이 이를 더 잘 학습하도록 하는 방법입니다. 배깅과 달리 모델 간에 의존성이 있으며 순차적으로 학습됩니다. 시험에서 "부스팅은 개별 모델에 동일한 가중치를 부여한다"는 보기가 나오면 틀린 것입니다. 가중치를 다르게 부여하여 오분류 데이터에 집중하는 것이 부스팅의 핵심입니다. 또한 "앙상블은 항상 단일 모형보다 정확하다"는 보기도 항상 그런 것은 아니므로 틀립니다. **그래디언트 부스팅(Gradient Boosting)**은 이전 모델의 잔차(오차)를 다음 모델이 학습하는 부스팅 기법입니다. **XGBoost(eXtreme Gradient Boosting)**는 그래디언트 부스팅을 최적화하여 속도와 성능을 개선한 알고리즘으로, 정형 데이터 분류·회귀에서 높은 성능을 보입니다. 과적합 방지를 위한 정규화 옵션도 내장되어 있습니다. **LightGBM**은 XGBoost보다 학습 속도가 빠르고 메모리 효율이 높은 그래디언트 부스팅 알고리즘으로, 대용량 데이터에 적합합니다. --- ## 핵심 요약 & 시험 포인트 ### 앙상블 기법 비교 | 기법 | 학습 방식 | 특징 | |------|-----------|------| | **배깅(Bagging)** | 병렬 (복원추출) | 분산 감소, 과적합 방지 | | **부스팅(Boosting)** | 순차 (오류 가중치) | 편향 감소, 과적합 위험 | | **랜덤포레스트** | 병렬 + 변수 무작위 선택 | 배깅 + 변수 임의 선택 | | **스태킹(Stacking)** | 메타 학습기 결합 | 여러 모델 예측을 재학습 | ### 그래디언트 부스팅 계열 | 알고리즘 | 특징 | |----------|------| | **XGBoost** | 그래디언트 부스팅 최적화, 정규화 내장 | | **LightGBM** | XGBoost보다 빠르고 메모리 효율 높음, 대용량 적합 | > **시험 포인트:** 배깅=병렬·복원추출, 부스팅=순차·오류 가중치. 랜덤포레스트는 **OOB(Out-Of-Bag)** 샘플(≈36.8%)로 검증 가능. --- --- ## 부스팅 알고리즘 변천 | 알고리즘 | 등장 | 특징 | |---------|------|------| | **AdaBoost** (1996) | 오리지널 | 오분류 데이터에 가중치 증가, 약한 학습기(주로 stump) 결합 | | **GBM** (Gradient Boosting Machine) | 손실 함수의 경사 방향으로 학습 | 잔차 학습, 일반화된 부스팅 | | **XGBoost** (2014) | GBM + 정규화 + 병렬 처리 | Kaggle 우승 단골, 정형 데이터 최강 | | **LightGBM** (2017) | Microsoft, 리프 우선(Leaf-wise) 분할 | XGBoost보다 빠름, 대용량 적합 | | **CatBoost** (2017) | Yandex, 범주형 자동 처리 | 범주형 변수 인코딩 불필요, Ordered Boosting | ### AdaBoost 핵심 원리 1. 모든 데이터에 동일 가중치로 시작 2. 약한 학습기 학습 → 오분류 데이터의 가중치 증가 3. 다음 학습기는 어려운 데이터에 집중 4. 최종 예측은 학습기들의 가중 투표 ### CatBoost의 차별점 - 범주형 변수를 **타깃 인코딩 + 순서 통계**로 자동 처리 - 일반적인 원-핫 인코딩의 차원 폭발 방지 - Ordered Boosting으로 과적합 방지 > **시험 포인트**: AdaBoost = 오분류 가중치 조정. GBM 계열 = 잔차 학습. CatBoost = 범주형 자동 처리. ### 랜덤 포레스트(Random Forest) 심화 - 배깅 + 변수 무작위 선택을 결합한 의사결정나무 앙상블 - 각 분할마다 전체 변수 중 √p(분류) 또는 p/3(회귀)개만 후보로 사용 → 트리 간 상관성↓, 일반화↑ - **OOB(Out-of-Bag) 오차**: 부트스트랩 표본에 포함되지 않은 약 36.8% 데이터로 자체 검증 - **변수 중요도(Variable Importance)**: 평균 불순도 감소(MDI) 또는 OOB 순열중요도 ### 추가 앙상블 기법 - **보팅(Voting)**: 서로 다른 알고리즘의 예측을 다수결(hard) 또는 확률 평균(soft)으로 결합 - **스태킹(Stacking)**: 1단계 모델들의 예측을 2단계 메타학습기의 입력으로 사용 - **AdaBoost(에이다부스트)**: 오분류 샘플에 가중치 증가시키며 약한 분류기 반복 학습 - **그래디언트 부스팅(Gradient Boosting)**: 직전 모델의 잔차(또는 손실 기울기)를 새 트리로 학습 - **XGBoost / LightGBM / CatBoost**: 그래디언트 부스팅의 고성능 구현체 ### kNN과 나이브 베이즈 - **k-최근접 이웃(kNN)**: 거리 기반 비모수 분류 — 학습 단계 없음(lazy learning), k는 홀수 권장 - **나이브 베이즈(Naive Bayes)**: 모든 특성이 조건부 독립이라는 '나이브' 가정 + 베이즈 정리 - **라플라스 스무딩(Laplace Smoothing)**: 0 확률 문제 회피를 위해 모든 빈도에 +1 ### 자기조직화지도 (SOM) - **SOM(Self-Organizing Map)**: 비지도 신경망 — 고차원 데이터를 저차원 격자에 위상 보존 매핑 - **BMU(Best Matching Unit)**: 입력 벡터와 가장 가까운 가중치를 가진 출력 뉴런 — 학습 시 BMU와 이웃의 가중치를 입력 방향으로 이동 - 활용: 고객 군집화 시각화, 차원축소 ### 부스팅의 학습기 개념 - **약한 학습기(Weak Learner)**: 무작위보다 약간 더 좋은 성능의 모델 (정확도 50% 초과) - **강한 학습기(Strong Learner)**: 약한 학습기 여러 개를 결합한 고성능 모델 - **부스팅의 핵심**: 약한 학습기들을 순차적으로 결합해 강한 학습기 생성 ### 비용 민감 학습 - **Cost-sensitive Learning**: 오분류에 따른 비용이 다를 때 적용 - 양성 → 음성 오분류와 음성 → 양성 오분류의 비용이 비대칭일 때 - 의료 진단(놓치면 치명적), 사기 탐지(놓치면 큰 손해)에 필수 ### Voting 세부 - **Hard Voting(다수결 투표)**: 각 모델의 예측 클래스를 다수결로 결정 — 단순·직관적 - **Soft Voting(가중 평균 투표)**: 각 모델의 클래스 확률을 평균 후 최대 확률 클래스 선택 — 일반적으로 Hard보다 우수 - 전제: 모델들이 잘 보정된 확률을 출력해야 Soft Voting 효과적 ### Stacking 상세 - **Stacking(Stacked Generalization)** 절차: 1. **기본 모형(Base Learner)** 훈련: 여러 다양한 알고리즘 (RF·SVM·로지스틱 등) 2. 기본 모형 예측값을 새 특성으로 사용 3. **메타 학습기(Meta Learner)** 훈련: 보통 로지스틱·간단한 모델 - **누수 방지**: 기본 모형 예측은 교차검증 fold에서 생성해 학습-평가 분리 ### 나이브 베이즈(Naive Bayes) 변종 - **Gaussian Naive Bayes**: 연속형 특성이 정규분포를 따른다고 가정 - 각 클래스별로 평균·분산 추정 → 정규분포 PDF로 우도 계산 - 활용: 연속형 입력의 일반 분류 - **Multinomial Naive Bayes**: 이산형 카운트(빈도) 데이터에 적합 - 단어 빈도 등 카운트 기반 — 텍스트 분류의 표준 - 활용: 스팸 필터·문서 분류·감성 분석 - **Bernoulli Naive Bayes**: 이진(0/1) 특성에 적합 - 단어의 등장 여부(유무) — 부재 정보도 활용 - 활용: 짧은 문서·검색어 매칭 - **공통 가정**: 모든 특성이 클래스 조건부 독립이라는 강한 가정 (현실엔 거의 안 맞지만 잘 작동) - **라플라스 스무딩**: 빈도 0인 단어로 인한 0 확률 회피 ### OOB Score (Out-of-Bag Score) - **OOB(Out-of-Bag) 샘플**: 부트스트랩 표본에 포함되지 않은 약 36.8%의 원본 데이터 - 부트스트랩에서 한 샘플이 뽑히지 않을 확률 = (1−1/n)ⁿ ≈ 1/e ≈ 0.368 - **OOB Score / OOB Error**: 각 트리에서 OOB 샘플로 평가한 오류율의 평균 - 별도 검증 셋 없이도 모델 평가 가능 → 데이터 효율적 활용 - 랜덤 포레스트의 표준 평가 지표 ### Bagging vs Boosting 비교 | 구분 | Bagging | Boosting | |------|---------|----------| | 학습 | 병렬 (독립적) | 순차적 (이전 오차 보완) | | 데이터 | Bootstrap 표본 | 가중치 부여 | | 결합 | 평균/투표 | 가중 합 | | 편향-분산 | 분산 감소 위주 | 편향 감소 위주 | | 대표 | Random Forest | AdaBoost·GBM·XGBoost·LightGBM | | 과적합 | 강건 | 민감 (조절 필요) | ### Voting Classifier - **Hard Voting**: 다수결로 클래스 결정 - **Soft Voting**: 각 모델의 클래스 확률 평균 후 결정 — 일반적으로 더 우수 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **OOB오차** — 부트스트랩 표본에 포함되지 않은 약 36.8% 데이터로 자체 검증 - **그래디언트 부스팅** — 직전 모델의 잔차(또는 손실 기울기)를 새 트리로 학습 - **k-최근접 이웃** — 거리 기반 비모수 분류 — 학습 단계 없음(lazy learning), k는 홀수 권장 - **라플라스 스무딩** — 0 확률 문제 회피를 위해 모든 빈도에 +1 - **강한 학습기** — 약한 학습기 여러 개를 결합한 고성능 모델 - **부스팅의 핵심** — 약한 학습기들을 순차적으로 결합해 강한 학습기 생성 - **Hard Voting** — 각 모델의 예측 클래스를 다수결로 결정 — 단순·직관적 - **Soft Voting** — 각 모델의 클래스 확률을 평균 후 최대 확률 클래스 선택 — 일반적으로 Hard보다 우수 - **AdaBoost** — 오분류 샘플에 가중치 증가시키며 약한 분류기 반복 학습 - **OOB Score / OOB Error** — 각 트리에서 OOB 샘플로 평가한 오류율의 평균 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 군집분석 URL: https://adsp.todaycode.kr/study/31 태그: 기술통계, 인공신경망, 군집분석, 차원 축소, 변수 선택, 판별분석, 텍스트 마이닝, 거리 측정, 이상치·결측, 데이터 기반 의사결정, 강화학습·지도학습 군집분석은 유사한 특성을 가진 데이터들을 자동으로 그룹(군집)으로 묶는 비지도학습 방법입니다. 분류분석과 달리 미리 정해진 그룹이 없는 상태에서 데이터 자체의 패턴을 기반으로 그룹을 형성합니다. **K-Means**는 가장 대표적인 비계층적 군집분석 기법입니다. K-Means는 이상치(Outlier)에 민감하다는 단점이 있습니다. 이를 보완한 **K-medoids(PAM, Partitioning Around Medoids)**는 중심점으로 평균 대신 실제 데이터 포인트(대표 개체)를 사용하므로 이상치에 강합니다. 먼저 무작위로 K개의 초기 중심점을 설정한 후, 각 데이터를 가장 가까운 중심점에 할당하고, 각 군집의 중심점을 재계산하는 과정을 수렴할 때까지 반복합니다. 시험에서 "군집 개수 K를 알고리즘이 자동으로 선택한다"는 보기가 나오면 틀린 것입니다. **K는 사용자가 미리 지정**해야 합니다. 또한 "초기 중심값 설정은 결과에 영향을 주지 않는다"도 틀린 설명입니다. 최적 K를 결정하는 방법으로는 **엘보우 방법(Elbow Method)**과 **실루엣 계수(Silhouette Coefficient)**가 있습니다. 엘보우 방법은 K 값에 따른 군집 내 제곱합(WSS, Within-cluster Sum of Squares)을 그래프로 그려서 감소 기울기가 급격히 완만해지는 꺾이는 지점(Elbow Point)을 최적 K로 선택합니다. 실루엣 계수는 -1에서 1 사이의 값으로, 군집 내 응집도와 군집 간 분리도를 종합하여 군집 품질을 평가합니다. 값이 1에 가까울수록 이상적인 군집화이며, 0에 가까우면 군집 경계에 위치하고, 음수이면 잘못 분류된 것입니다. **계층적 군집분석**은 데이터를 단계적으로 합치거나 나누면서 계층적 구조(덴드로그램)를 형성합니다. 군집 간 거리 측정 방법으로 단일연결법(최단 거리), 최장연결법(최대 거리), 평균연결법(평균 거리), 와드연결법(군집 내 오차제곱합 SSE를 최소화)이 있습니다. **DBSCAN**은 밀도 기반 군집화 방식으로 군집 개수를 미리 정할 필요가 없으며, 초기 중심값도 불필요합니다. **SOM(자기조직화지도)**은 경쟁학습 기반 신경망으로 차원 축소와 군집화를 동시에 수행합니다. 유사도(거리) 측정에는 유클리디안 거리, 맨하탄 거리, 마할라노비스 거리(변수 간 상관관계를 고려), 자카드 거리(범주형 데이터 간 유사도) 등이 사용됩니다. 자카드 거리는 연속형이 아닌 범주형 데이터에 적합하므로, "연속형 변수 간 거리 측정 방법"으로는 부적절합니다. --- --- ## 핵심 요약 & 시험 포인트 ### 군집분석 기법 비교 | 기법 | 유형 | K 사전지정 | 특징 | |------|------|------------|------| | **K-Means** | 비계층적 | 필요 | 구형 군집, 초기 중심값에 민감 | | **계층적 군집** | 계층적 | 불필요 | 덴드로그램 시각화, 와드연결법(SSE 최소화) | | **DBSCAN** | 밀도 기반 | 불필요 | 비구형 군집, 이상치 탐지 | | **SOM** | 신경망 | 필요 | 차원 축소 + 군집화 동시 수행 | ### 최적 K 결정 방법 | 방법 | 설명 | |------|------| | **엘보우(Elbow)** | WSS 그래프에서 기울기가 급격히 완만해지는 지점 | | **실루엣 계수** | -1~1 범위, 1에 가까울수록 이상적 군집화 | > **시험 포인트:** K-Means는 K를 분석가가 **사전 지정**해야 합니다. DBSCAN은 K 지정이 불필요합니다. --- --- ## 유사도·거리 측정법 종합 정리 ### 연속형 변수 거리 | 측정법 | 수식 | 특징 | |--------|------|------| | **유클리드(Euclidean)** | √Σ(xᵢ-yᵢ)² | 가장 일반적, 직선 거리 | | **맨해튼(Manhattan)** | Σ\|xᵢ-yᵢ\| | L1 거리, 격자 거리 | | **민코프스키(Minkowski)** | (Σ\|xᵢ-yᵢ\|^p)^(1/p) | 일반화 거리 (p=1: 맨해튼, p=2: 유클리드) | | **체비셰프(Chebyshev)** | max\|xᵢ-yᵢ\| | 민코프스키 p→∞, 체스의 킹 | | **마할라노비스(Mahalanobis)** | 변수 간 공분산 고려 | 변수 상관·스케일 보정 | ### 범주형/특수 데이터 거리 | 측정법 | 수식 | 사용처 | |--------|------|--------| | **자카드(Jaccard)** | \|A∩B\|/\|A∪B\| | 집합·이진 데이터 (0과 1) | | **코사인 유사도(Cosine)** | A·B / (\|A\|·\|B\|) | 텍스트 (TF-IDF), 고차원 벡터 | | **편집 거리(Levenshtein)** | 삽입·삭제·교체 횟수 | 문자열 비교 | | **해밍(Hamming)** | 다른 위치의 수 | 동일 길이 이진 문자열 | ### 거리 vs 유사도 - **거리(Distance)**: 작을수록 가까움 (0=동일) - **유사도(Similarity)**: 클수록 가까움 (1=동일) - 코사인은 유사도(1=동일 방향), 코사인 거리 = 1 - 코사인 유사도 > **시험 포인트**: 텍스트 → **코사인**, 이진/집합 → **자카드**, 변수 상관 고려 → **마할라노비스**, 격자 → **맨해튼**. --- ## 추가 핵심 개념 — GMM·EM 알고리즘과 군집 변형 - **GMM(Gaussian Mixture Model)**: 데이터가 여러 가우시안 분포의 혼합에서 생성됐다고 가정해 각 데이터가 어느 분포에 속할 확률을 추정하는 확률적 군집 기법. K-means보다 유연(타원형 군집 가능). - **EM 알고리즘(Expectation-Maximization)**: 잠재변수가 있는 모형의 최대가능도(MLE) 추정 반복 알고리즘. - **E-step**: 현재 파라미터로 잠재변수의 사후확률·기대값 계산 - **M-step**: 그 기대값을 최대화하는 파라미터 재추정 - GMM·HMM·결측치 추정에 활용. 국소 최적해·초기값 민감 - **K-medoids(PAM, Partitioning Around Medoids)**: K-means에서 평균(mean) 대신 실제 데이터 포인트(medoid)를 중심으로 사용. 이상치에 강건. 계산 비용 O(k(n−k)²)로 대용량에는 부적합. 대용량 변형: CLARA, CLARANS. - **DBSCAN(Density-Based Spatial Clustering)**: 밀도 기반 군집화. 군집 수 사전 지정 불필요, 비구형 군집 탐지·노이즈 자동 식별. 파라미터: ε(반경), minPts(핵심점 최소 이웃 수). > **시험 핵심**: K-means(평균·이상치 민감)·K-medoids(이상치 강건)·DBSCAN(밀도·노이즈 자동)·GMM(확률·EM)의 차이가 군집 단원의 빈출 출제입니다. ### 계층적 군집화 연결법 - **단일/최단 연결법(Single Linkage)**: 두 군집의 가장 가까운 두 점 거리. 사슬효과(chaining) - **완전/최장 연결법(Complete Linkage)**: 두 군집의 가장 먼 두 점 거리. 작고 조밀한 군집 생성 - **평균 연결법(Average Linkage)**: 두 군집의 모든 쌍 평균 거리 - **중심 연결법(Centroid)**: 두 군집 중심 간 거리 - **Ward 연결법**: 군집 내 분산 증가량이 최소가 되도록 병합 — 균형 잡힌 군집 형성 ### 비계층적 군집화 추가 - **DBSCAN(Density-Based)**: 밀도 기반. eps(이웃 반경)·minPts 파라미터로 잡음(noise) 자동 식별. 군집 수 사전 지정 불필요 - **EM 알고리즘 / GMM(Gaussian Mixture Model)**: 데이터가 여러 정규분포의 혼합이라 가정 — 소프트 군집(확률적 소속) ### 군집 평가 지표 - **실루엣 계수(Silhouette)**: (b−a)/max(a,b). [−1, 1] 범위, 1에 가까울수록 잘 군집화 - **Davies-Bouldin Index**: 군집 내 산포 / 군집 간 거리 — 작을수록 좋음 - **Calinski-Harabasz Index**: 군집 간 분산 / 군집 내 분산 — 클수록 좋음 - **엘보우(Elbow) / 팔꿈치 기법**: WCSS(군집 내 제곱합)를 k에 따라 그려 꺾이는 지점 선택 ### k-평균 군집 (K-means) - **K-means**: 군집 중심을 무작위로 초기화 → 가까운 점 할당 → 중심 재계산 반복 - **수렴 조건**: 할당 변화 없거나 중심 변화 임계값 이하 - **단점**: 초기값 민감, 군집 수 k 사전 지정, 구형 군집 가정 - **k 결정**: 엘보우·실루엣·Gap statistic - **K-medoids / PAM**: 중심을 실제 데이터 점으로 사용 — 이상치에 강건 ### 계층적 군집 시각화 - **덴드로그램(Dendrogram)**: 계층적 군집 결과를 트리로 시각화. 자르는 높이가 군집 수 결정 - **계층적 vs 비계층적**: 사전 군집 수 불필요 vs 필요 ### 거리(Distance) 측도 - **유클리드 거리**: √Σ(xᵢ−yᵢ)² — 가장 보편 - **맨해튼 거리**: Σ|xᵢ−yᵢ| — 격자 거리 - **민코프스키 거리(Minkowski)**: (Σ|xᵢ−yᵢ|ᵖ)^(1/p) — p=1 맨해튼, p=2 유클리드의 일반화 - **마할라노비스 거리(Mahalanobis)**: 공분산을 반영한 거리 — 변수 간 상관성 보정 - **체비셰프 거리**: max|xᵢ−yᵢ| — 가장 큰 차원 차이 ### 계층적 군집 방향성 - **응집형(Agglomerative)**: Bottom-up — 각 점을 개별 군집으로 시작해 가까운 군집끼리 병합. 가장 일반적 - **분리형(Divisive)**: Top-down — 전체를 하나의 군집으로 시작해 분할 - **Hierarchical Clustering**: 응집형·분리형의 총칭 ### 단일연결법의 사슬효과 - **사슬효과(Chaining Effect)**: Single Linkage가 점들을 사슬처럼 연결해 길고 가는 군집을 만드는 현상 — Complete·Ward로 완화 ### DBSCAN 구성요소 - **Core Point(핵심점)**: eps 반경 내 minPts 이상의 점을 가진 점 - **Border Point(경계점)**: 핵심점은 아니지만 핵심점의 이웃 - **Noise / Outlier Point**: 핵심점·경계점 어디에도 속하지 않는 점 ### 최적 k 결정 - **Gap Statistic**: 실제 데이터의 WCSS와 무작위 균등 분포 데이터의 WCSS 차이로 최적 k 선택 — 엘보우보다 객관적 ### 혼합형 데이터 군집 - **K-prototype**: 수치형 + 범주형 데이터 동시 처리 — K-means(수치) + K-modes(범주) 결합 - **K-modes**: 범주형 데이터 전용 K-means - **Fuzzy C-means(퍼지 군집)**: 한 점이 여러 군집에 부분 소속 (Soft Clustering) - **Hard / Soft Clustering**: 단일 소속 vs 확률·정도 소속 - **Crisp Clustering**: Hard Clustering의 동의어 ### 추가 거리 측도 - **표준화 거리(Standardized Distance)**: 변수마다 다른 단위를 표준화 후 계산 - **Gower 거리**: 수치형·범주형 혼합 데이터의 거리 - **Hamming 거리**: 같은 길이의 두 문자열의 차이 자릿수 — 범주형·이진 변수 - **코사인 거리**: 1 − 코사인 유사도 ### 군집화 분산 분해 - **TSS(Total Sum of Squares)**: 전체 분산 = Σ‖xᵢ − x̄‖² - **WCSS(Within-Cluster Sum of Squares)**: 군집 내 분산 — 작을수록 군집이 응집 - **BSS(Between-Cluster Sum of Squares)**: 군집 간 분산 — 클수록 군집이 분리 - **TSS = WCSS + BSS** (분산 분해) - 좋은 군집화: WCSS 작고 BSS 큼 ### 군집화 평가 추가 - **응집도(Cohesion)**: 군집 내 점들의 가까움 — WCSS로 측정 - **분리도(Separation)**: 군집 간 거리 — BSS로 측정 - 실루엣 계수: 응집도와 분리도를 동시에 반영 ### 군집 알고리즘 큰 분류 - **응집 군집(Agglomerative)**: 개별 점에서 시작 → 병합 (Bottom-up) - **분할 군집(Divisive)**: 전체에서 시작 → 분할 (Top-down) ### 최적 군집 수 결정 - **최적 군집 수(Optimal k)** 판단 방법: - **엘보우(Elbow) 방법**: WCSS가 급격히 줄다가 완만해지는 지점 - **실루엣 분석**: 평균 실루엣 계수가 최대가 되는 k - **Gap Statistic**: 무작위 데이터 대비 군집 구조의 우수성 - **Davies-Bouldin·Calinski-Harabasz Index** ### DBSCAN 추가 개념 - **Density-Reachable(밀도 도달 가능)**: 한 핵심점에서 다른 점까지 핵심점들의 연쇄로 도달 가능 - **Density-Connected(밀도 연결)**: 둘 모두 같은 핵심점에서 도달 가능 - DBSCAN의 군집 정의: 밀도 연결된 점들의 최대 집합 ### 군집 모양·평가 - **Compact(응집된/조밀한) Cluster**: 군집 내부 거리가 작아 조밀한 군집 - **Inter-cluster(군집 간) 이질성**: 군집 간 거리가 클수록 좋음 - **Intra-cluster(군집 내) 동질성**: 군집 내 거리가 작을수록 좋음 ### 단일연결법의 사슬 효과 - **사슬 효과(Chaining Effect)**: Single Linkage가 점들을 사슬처럼 연결해 길고 가는 군집을 만드는 현상 - 두 군집 사이에 다리(Bridge) 역할 점이 있으면 두 군집이 하나로 병합됨 - 해결: Complete Linkage·Average·Ward 사용 ### 군집 결과 평가 추가 - **Bootstrap Stability**: 부트스트랩 표본 군집화 결과의 안정성 평가 - **Adjusted Rand Index(ARI)**: 두 군집 결과의 일치도 — 우연 일치 보정 - **NMI(Normalized Mutual Information)**: 정보이론 기반 군집 평가 ### K-medoids 보강 - **K-medoids / PAM(Partitioning Around Medoids)**: 중심을 실제 데이터 점(medoid)으로 사용 - K-means보다 이상치에 강건, 계산 비용 큼 - **CLARA(Clustering Large Applications)**: 표본 추출로 K-medoids 가속화 ### 거리 행렬 (Distance Matrix) - **거리 행렬(Distance Matrix)**: n×n 행렬로 모든 쌍의 거리를 저장 - dᵢⱼ = d(xᵢ, xⱼ) - 대각선은 0, 대칭행렬 - 계층적 군집·MDS의 입력 - **비유사도 행렬(Dissimilarity Matrix)**: 거리 행렬과 동의어로 사용 - **근접성 행렬(Proximity Matrix)**: 유사도 또는 거리 — 군집·SNA에서 사용 - 거리 행렬의 메모리: O(n²) → 대용량 데이터에서 부담 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **단일/최단 연결법** — 두 군집의 가장 가까운 두 점 거리. 사슬효과(chaining) - **완전/최장 연결법** — 두 군집의 가장 먼 두 점 거리. 작고 조밀한 군집 생성 - **Ward 연결법** — 군집 내 분산 증가량이 최소가 되도록 병합 — 균형 잡힌 군집 형성 - **EM 알고리즘 / GMM** — 데이터가 여러 정규분포의 혼합이라 가정 — 소프트 군집(확률적 소속) - **Davies-Bouldin Index** — 군집 내 산포 / 군집 간 거리 — 작을수록 좋음 - **Calinski-Harabasz Index** — 군집 간 분산 / 군집 내 분산 — 클수록 좋음 - **엘보우(Elbow) / 팔꿈치 기법** — WCSS(군집 내 제곱합)를 k에 따라 그려 꺾이는 지점 선택 - **수렴 조건** — 할당 변화 없거나 중심 변화 임계값 이하 - **체비셰프 거리** — max|xᵢ−yᵢ| — 가장 큰 차원 차이 - **Noise / Outlier Point** — 핵심점·경계점 어디에도 속하지 않는 점 - **K-prototype** — 수치형 + 범주형 데이터 동시 처리 — K-means(수치) + K-modes(범주) 결합 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 연관분석 URL: https://adsp.todaycode.kr/study/32 태그: 데이터베이스, 분석 주제 유형, 상관분석, 의사결정나무, 연관분석, 탐색적 분석 연관분석은 데이터 속에서 항목들 간의 관련성(연관규칙)을 발견하는 분석 기법입니다. "기저귀를 사는 고객이 맥주도 함께 산다"는 장바구니 분석이 가장 유명한 사례입니다. 연관분석의 세 가지 핵심 지표가 있습니다. **지지도(Support)**는 전체 거래 중에서 A와 B를 동시에 구매한 거래의 비율입니다. 수식으로는 P(A∩B)=A와B 동시구매건수/전체거래건수입니다. **신뢰도(Confidence)**는 A를 구매한 거래 중에서 B도 함께 구매한 비율입니다. 수식으로는 P(B|A)=P(A∩B)/P(A)입니다. **향상도(Lift)**는 A를 구매한 사람이 B를 구매할 확률이, B의 전체 구매 확률에 비해 얼마나 높은지를 나타냅니다. 수식으로는 P(B|A)/P(B)=신뢰도/P(B)입니다. **향상도가 1보다 크면 양의 연관성, 1이면 독립(무관), 1보다 작으면 음의 연관성**입니다. **Apriori 알고리즘**은 연관규칙을 찾는 대표적 알고리즘으로, 최소 지지도를 설정→개별 품목 중 최소 지지도를 넘는 품목 선별→2개 이상의 품목 조합으로 확장→반복하여 빈발 항목 집합을 발견하는 순서로 진행됩니다. Apriori의 핵심 원리는 **반단조성(Anti-monotone property)**: 빈발하지 않는 항목 집합의 상위 집합은 빈발하지 않으므로 탐색을 가지치기합니다. 그러나 데이터 스캔 횟수가 많아 대용량 데이터에 비효율적이라는 단점이 있습니다. **FP-Growth 알고리즘**은 데이터를 FP-Tree 자료구조로 압축하여 반복 스캔 없이 연관규칙을 탐색하는 개선된 알고리즘입니다. Apriori는 데이터베이스를 여러 번 스캔해야 하는 반면, FP-Growth는 2회 스캔으로 FP-Tree를 구성하므로 **대용량 데이터에 더 효율적**입니다. 다만 FP-Tree를 메모리에 유지해야 하므로 데이터가 매우 희소(Sparse)하면 메모리 비용이 증가할 수 있습니다. 연관분석의 장점은 조건반응(If-then) 기반으로 결과 해석이 쉽고, 특별한 목적 없이도 데이터 탐색이 가능하며, 데이터 변환 없이 원본을 그대로 사용할 수 있다는 점입니다. "연관분석은 변수 간 선형 관계를 파악하는 방법"이라는 보기가 나오면 이는 상관분석의 설명이므로 틀린 것입니다. --- ## 핵심 요약 & 시험 포인트 ### 연관규칙 3대 지표 수식 | 지표 | 수식 | 의미 | |------|------|------| | **지지도(Support)** | P(A∩B) = (A,B 동시)/(전체) | 전체에서 함께 구매 비율 | | **신뢰도(Confidence)** | P(B\|A) = P(A∩B)/P(A) | A구매 중 B도 구매 비율 | | **향상도(Lift)** | 신뢰도/P(B) | 1>독립, 1=무관, 1<양의 연관 | ### Apriori vs FP-Growth | 알고리즘 | 특징 | 장점 | 단점 | |----------|------|------|------| | **Apriori** | 반단조성(Anti-monotone) 활용 | 이해 쉬움 | 반복 스캔으로 느림 | | **FP-Growth** | FP-Tree로 2회 스캔 | 빠름, 대용량 적합 | 희소 데이터 시 메모리↑ | > **시험 포인트:** 향상도>1이면 양의 연관성. Apriori 핵심: 빈발하지 않는 항목집합의 상위집합도 빈발하지 않음(반단조성). 연관분석 ≠ 변수 간 선형 관계(그것은 상관분석). --- ### 연관규칙 마이닝 핵심 원리 - **Association Rule Mining**: 항목 집합 사이의 IF-THEN 규칙 추출 (예: 빵 → 우유) - **장바구니 분석(Market Basket Analysis)**: 함께 구매되는 상품 집합 분석 — 연관규칙의 대표 응용 - **Downward Closure(하향 닫힘 / 반(反)단조성)**: "빈발 집합의 모든 부분집합도 빈발이다" - 대우: 비빈발 집합의 모든 상위 집합도 비빈발 → Apriori 알고리즘의 가지치기 핵심 원리 ### 교차판매·상향판매 - **Cross-Sell(교차판매)**: 연관 상품 추천 (보험 + 적금) - **Up-Sell(상향판매)**: 더 비싼 모델·옵션 추천 (스탠다드 → 프리미엄) ### 연관규칙 표현 - **발생 규칙(If A then B)**: 항목 A가 등장하면 B가 함께 등장하는 규칙 - **Antecedent(전건, A) → Consequent(후건, B)** - 평가 지표: Support·Confidence·Lift·Conviction·Leverage ### Apriori 알고리즘 핵심 - **Association Rule Mining(Apriori)**: 빈발 항목집합 → 강한 연관규칙 도출 - 단계: 빈발집합 탐색 → 규칙 생성 → 신뢰도·향상도 필터링 ### 순차 패턴 마이닝 - **Sequential Pattern Mining(시퀀스 패턴 마이닝)**: 시간 순서가 있는 항목집합에서 자주 등장하는 패턴 발견 - **PrefixSpan**: 접두사 기반 효율적 알고리즘 - **GSP(Generalized Sequential Pattern)**: 시간 제약·계층 지원 - 활용: 웹 클릭스트림·DNA 서열·구매 시퀀스·고객 행동 분석 ### 연관규칙 평가 추가 - **Conviction**: (1−Support(B)) / (1−Confidence) - **Leverage**: Support(A∩B) − Support(A)·Support(B) ### 조합 최적화 문제 - **NP-Hard / NP-Complete**: 다항 시간에 해결 불가능하다고 추정되는 문제 — 메타휴리스틱이 필요한 이유 - **TSP(Traveling Salesman Problem, 외판원 문제)**: n개 도시를 모두 정확히 한 번씩 방문하고 출발지로 돌아오는 최단 경로 - **VRP(Vehicle Routing Problem, 차량 경로 문제)**: 다수 차량으로 다수 고객을 방문하는 최적 경로 — 물류·배송에 응용 - **일정 계획(Scheduling) / Bin Packing / 신경망 구조 탐색(NAS)**: 모두 NP-Hard 계열로 메타휴리스틱 활용 ### Apriori의 핵심 원리 - **Anti-monotone 속성 / 반단조성(Antimonotonicity)**: 빈발 항목집합의 모든 부분집합도 빈발 - 대우: 비빈발 집합의 모든 상위 집합도 비빈발 - Apriori의 가지치기(Pruning) 핵심 — 검색 공간 대폭 축소 - 동의어: Downward Closure Property - **min-support / minimum support(최소 지지도)**: 빈발 여부를 판단하는 임계값 - 낮으면 더 많은 규칙·계산 폭증 - 높으면 누락 위험 — 비즈니스에 따라 균형 선택 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **Association Rule Mining** — 항목 집합 사이의 IF-THEN 규칙 추출 (예: 빵 → 우유) - **Downward Closure(하향 닫힘 / 반(反)단조성)** — "빈발 집합의 모든 부분집합도 빈발이다" - **Up-Sell** — 더 비싼 모델·옵션 추천 (스탠다드 → 프리미엄) - **발생 규칙** — 항목 A가 등장하면 B가 함께 등장하는 규칙 - **Antecedent(전건, A) → Consequent(후건, B)** — 평가 지표: Support·Confidence·Lift·Conviction·Leverage - **Sequential Pattern Mining** — 시간 순서가 있는 항목집합에서 자주 등장하는 패턴 발견 - **Conviction** — (1−Support(B)) / (1−Confidence) > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 차원 축소 — 주성분분석(PCA)과 다차원척도법(MDS) URL: https://adsp.todaycode.kr/study/33 태그: 빅데이터 3V/5V, 기술통계, 인공신경망, 차원 축소, 과적합, 데이터 전처리, 판별분석, 데이터 기반 의사결정, 추천 시스템, 강화학습·지도학습 차원 축소는 많은 변수를 가진 데이터에서 핵심적인 정보만 추출하여 변수의 수를 줄이는 기법입니다. 변수가 너무 많으면 분석이 복잡해지고 과적합이 발생할 수 있기 때문입니다. **주성분분석(PCA, Principal Component Analysis)**은 상관관계가 높은 여러 변수들을 선형 결합하여 더 적은 수의 새로운 변수(주성분)를 만들어내는 비지도학습 기법입니다. 각 주성분은 원래 데이터의 분산을 최대한 설명하는 방향으로 생성되며, **첫 번째 주성분이 가장 많은 분산(정보)을 담습니다**. **주성분 간에는 상관관계가 없다(직교한다)**는 것이 중요한 특징입니다. 시험에서 "주성분 간에는 상관관계가 있다"는 보기가 나오면 틀린 것입니다. 주성분의 수는 변수의 수보다 작거나 같으며, **Scree plot**에서 **고유값(Eigenvalue)**이 급격히 감소하는 지점(elbow point)까지의 주성분을 유의미하다고 판단합니다. Kaiser 기준으로는 고유값이 **1 이상**인 주성분을 선택합니다. 누적 분산 설명 비율이 70~80% 이상이 되는 시점까지 주성분을 선택하기도 합니다. 주의: PCA 수행 전에 변수 간 척도가 다른 경우 반드시 **표준화(Standardization)**를 적용해야 합니다. 그렇지 않으면 분산이 큰 변수가 첫 번째 주성분을 지배하게 됩니다. **다차원척도법(MDS, Multidimensional Scaling)**은 개체들 간의 거리 정보를 2차원이나 3차원 공간에 시각화하여, 유사한 개체는 가깝게 다른 개체는 멀게 배치하는 기법입니다. 영화 간 유사성 분석, 브랜드 포지셔닝 분석 등에 활용됩니다. MDS는 상대적 위치 관계를 보여주는 것이지 절대적 위치를 알 수 있는 것은 아닙니다. "MDS로 절대적 위치를 알 수 있다"는 보기가 나오면 틀린 것입니다. --- ## 핵심 요약 & 시험 포인트 ### PCA vs MDS 비교 | 기법 | 목적 | 입력 | 출력 | |------|------|------|------| | **PCA** | 분산 최대 보존하여 차원 축소 | 원본 데이터 행렬 | 주성분(직교 벡터) | | **MDS** | 거리 정보 보존하여 저차원 시각화 | 거리·비유사성 행렬 | 저차원 좌표 | ### PCA 핵심 사항 | 항목 | 설명 | |------|------| | **주성분 수** | 최대 원래 변수 수와 동일 | | **주성분 간 관계** | 서로 **직교(무상관)** | | **분산 설명량** | 1번 주성분 > 2번 > 3번 순서로 감소 | | **전처리 필수** | 변수 단위가 다르면 **표준화** 필요 | > **시험 포인트:** MDS는 **상대적** 위치 관계만 표현 (절대적 위치 불가). PCA는 비지도학습으로 레이블 없이 차원 축소. PCA 적용 전 변수 척도가 다르면 **반드시 표준화**. --- --- ## 차원 축소 기법 종합 ### 선형 차원 축소 | 기법 | 학습 | 목적 | |------|------|------| | **PCA** (주성분분석) | 비지도 | 분산 최대화 | | **SVD** (특이값 분해) | 비지도 | X = UΣV^T 행렬 분해, PCA의 일반화 | | **LDA** (선형판별분석) | **지도** (레이블 사용) | 클래스 분리 최대화 | | **MDS** (다차원척도법) | 비지도 | 개체 간 거리 보존 | ### 비선형 차원 축소 | 기법 | 특징 | |------|------| | **t-SNE** | 비선형, 시각화 특화, 군집 보존 (전역 구조 약함) | | **UMAP** | t-SNE보다 빠름, 전역 구조도 보존 | | **Autoencoder** | 신경망 기반, 인코더+디코더 | | **Kernel PCA** | 커널 트릭으로 비선형 PCA | ## LDA vs PCA — 헷갈리는 두 차원축소 | 구분 | LDA (Linear Discriminant Analysis) | PCA (Principal Component Analysis) | |------|----------------------------------|-----------------------------------| | 학습 유형 | **지도학습** (클래스 레이블 사용) | **비지도학습** | | 목적 | 클래스 **간 분산 최대화 / 내 분산 최소화** | 전체 **분산 최대화** | | 결과 컴포넌트 수 | 최대 (클래스 수 - 1) | 변수 수까지 | | 사용처 | 분류 전 차원 축소 | 일반 차원 축소·시각화 | > **⚠️ 주의**: 토픽 모델링 LDA(Latent Dirichlet Allocation)와 다른 알고리즘! > 차원축소 LDA = Linear Discriminant Analysis (선형판별분석) ### SVD 활용 사례 - **PCA의 계산**: PCA는 공분산 행렬의 SVD로 계산 가능 - **추천 시스템**: 사용자×아이템 행렬을 분해하여 잠재 요인 추출 - **LSA(Latent Semantic Analysis)**: 텍스트 차원 축소 > **시험 포인트**: PCA는 비지도, LDA는 지도. SVD는 PCA의 수학적 일반화. t-SNE는 시각화에 특화. ### PCA 핵심 수학 - **공분산행렬(Covariance Matrix)**: PCA의 입력 — 표준화된 데이터의 X'X/(n−1) - **고유값(Eigenvalue, λ)**: 각 주성분이 설명하는 분산의 크기 - **고유벡터(Eigenvector)**: 주성분의 방향(축) - **Scree Plot(스크리 플롯/도표)**: 고유값을 내림차순으로 그린 그래프 — 꺾이는(elbow) 지점에서 주성분 개수 선택 - **누적기여율(Cumulative Variance)**: 보통 70~90% 설명력에서 주성분 개수 결정 ### 비선형 차원축소 - **t-SNE**: 고차원 유사도를 저차원에서 보존 — 시각화에 강하나 거리 해석 주의 - **UMAP**: t-SNE보다 빠르고 전역 구조 보존도 우수 - **MDS(다차원척도법)**: 거리행렬을 입력으로 저차원에 점들을 배치 — 메트릭/비메트릭 MDS ### PCA 결과 해석 - **PC1, PC2(Principal Component 1, 2)**: 첫 번째·두 번째 주성분 — PC1이 가장 큰 분산 설명 - **부하량(Loading)**: 원변수가 주성분에 기여하는 정도 (고유벡터의 성분) — 절댓값이 클수록 그 변수의 영향력 큼 - **스코어(Score)**: 각 관측치의 주성분 좌표값 - **Biplot**: 부하량과 스코어를 동시에 그려 변수·관측치 관계 시각화 ### MDS 확장 - **Multi-Dimensional Scaling(MDS)**: 거리 정보로 저차원 좌표 복원 - **Classical MDS(메트릭)**: 유클리드 거리 보존 - **Non-metric MDS**: 순위만 보존 — 비유클리드 거리 OK ### 주성분 개수 결정 - **차원 결정(Dimension Selection) 기준**: - **누적기여율**: 70~90% - **Kaiser 기준**: 고유값 > 1 - **Scree plot의 elbow** - **교차검증 오차 최소** ### PCA 변형 - **Sparse PCA**: 부하량을 희소하게 만들어 해석 가능성 향상 - **Kernel PCA**: 커널 트릭으로 비선형 차원축소 - **ICA(Independent Component Analysis)**: 통계적 독립성을 기반으로 분리 — Cocktail party problem ### MDS Stress 함수 - **Stress 값(Stress Value)**: MDS가 거리 보존을 얼마나 잘 했는지 측정하는 손실함수 - Stress = √(Σ(dᵢⱼ − d̂ᵢⱼ)² / Σdᵢⱼ²) - **Kruskal Stress** 기준: - 0.025 미만: 매우 좋음(Excellent) - 0.05: 좋음(Good) - 0.1: 보통(Fair) - 0.2: 나쁨(Poor) - 0.2 이상: 거의 무의미 - MDS는 Stress를 최소화하도록 좌표 추정 — 반복 최적화 ### Sammon Mapping - **Sammon Mapping**: 가까운 점 쌍의 거리 보존에 가중치를 주는 MDS 변형 — 국소 구조 유지에 강점 ### 차원축소·고속 검색 추가 - **LSH(Locality Sensitive Hashing)**: 비슷한 입력은 같은 해시값을 가질 확률이 높은 해시 — 근사 최근접 이웃 검색에 활용 - **MinHash**: 자카드 유사도를 LSH로 빠르게 계산 - **SimHash**: 문서 유사도 계산을 위한 LSH 변형 (Google) - **ANN(Approximate Nearest Neighbor)**: 100% 정확도를 포기하고 빠르게 가까운 이웃 검색 — 추천·검색·Vector DB의 핵심 ### PCA의 수학적 제약 - **추출 가능한 주성분 수 = min(p, n−1)**: 변수 수(p)와 관측치 수(n−1) 중 작은 쪽 - 표본 공분산행렬의 최대 랭크가 n−1 - 고차원 저표본(p ≫ n) 데이터에서 PC가 n−1개로 제한 - **PCA의 한계**: - 선형 변환만 — 비선형 구조 포착 못함 (Kernel PCA·t-SNE·UMAP로 대체) - 분산 = 정보라는 가정에 의존 - 해석 가능성 저하 (주성분이 원변수의 선형결합) - **Kernel PCA**: 커널 트릭으로 비선형 차원축소 - **Nonlinear PCA / Autoencoder**: 신경망 기반 비선형 차원축소 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **공분산행렬** — PCA의 입력 — 표준화된 데이터의 X'X/(n−1) - **Scree Plot** — 고유값을 내림차순으로 그린 그래프 — 꺾이는(elbow) 지점에서 주성분 개수 선택 - **누적기여율** — 보통 70~90% 설명력에서 주성분 개수 결정 - **PC1, PC2** — 첫 번째·두 번째 주성분 — PC1이 가장 큰 분산 설명 - **부하량** — 원변수가 주성분에 기여하는 정도 (고유벡터의 성분) — 절댓값이 클수록 그 변수의 영향력 큼 - **Biplot** — 부하량과 스코어를 동시에 그려 변수·관측치 관계 시각화 - **Non-metric MDS** — 순위만 보존 — 비유클리드 거리 OK - **Sparse PCA** — 부하량을 희소하게 만들어 해석 가능성 향상 - **Stress 값** — MDS가 거리 보존을 얼마나 잘 했는지 측정하는 손실함수 - **PCA의 한계** — 선형 변환만 — 비선형 구조 포착 못함 (Kernel PCA·t-SNE·UMAP로 대체) > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 모형 평가 지표 URL: https://adsp.todaycode.kr/study/34 태그: 회귀분석, 군집분석, 연관분석, 모형 평가, ROC 곡선, 교차검증, 부트스트랩, 이상치·결측, 표본조사, 분류 임계값 분류 모형의 성능을 평가하기 위한 다양한 지표가 있으며, 이를 이해하려면 먼저 오분류표(혼동행렬, Confusion Matrix)를 알아야 합니다. 오분류표는 실제값과 예측값의 조합으로 네 가지 결과를 보여줍니다. **TP(True Positive)**는 실제 참을 참으로 올바르게 예측한 것, FP(False Positive)는 실제 거짓을 참으로 잘못 예측한 것, FN(False Negative)는 실제 참을 거짓으로 잘못 예측한 것, TN(True Negative)는 실제 거짓을 거짓으로 올바르게 예측한 것입니다. 정확도(Accuracy)는 전체 예측 중 올바르게 예측한 비율로, (TP+TN)/(TP+FP+FN+TN)입니다. **정밀도(Precision)**는 모델이 참이라고 예측한 것 중 실제로도 참인 비율로, TP/(TP+FP)입니다. **재현율(Recall, 민감도, Sensitivity)**은 실제 참인 것 중 모델이 참으로 올바르게 예측한 비율로, TP/(TP+FN)입니다. **F1-Score**는 정밀도와 재현율의 조화평균으로, F1 = 2×(정밀도×재현율)/(정밀도+재현율) = 2×TP/(2×TP+FP+FN)으로 계산합니다. 정밀도와 재현율이 동시에 높아야 F1이 높으므로, 두 지표의 균형을 평가할 때 사용합니다. 재현율을 더 중요시하면 **Fβ-Score(β>1)**, 정밀도를 더 중요시하면 **Fβ-Score(β<1)**를 사용합니다. **특이도(Specificity)**는 실제 거짓인 것 중 모델이 거짓으로 올바르게 예측한 비율로, TN/(FP+TN)입니다. **ROC 곡선(Receiver Operating Characteristic Curve)**은 X축에 1-특이도(FPR, 거짓 양성률), Y축에 민감도(TPR, 참 양성률)를 놓고 그린 곡선입니다. 곡선이 왼쪽 상단 모서리(0,1)에 가까울수록 좋은 모형이며, AUC(곡선 아래 면적)가 1에 가까울수록 우수한 분류 성능을 의미합니다. 가장 이상적인 점은 (0,1) 좌표, 즉 거짓 양성률이 0이고 참 양성률이 1인 지점입니다. AUC 값 기준으로는 0.9 이상이면 우수, 0.7~0.9이면 적절, 0.5에 가까울수록 무작위 분류와 유사합니다. "AUC가 클수록 성능이 나쁘다"는 보기가 나오면 반대이므로 틀린 설명입니다. **향상도 곡선(Lift Curve)**은 랜덤 모델 대비 분류 모델의 성과 향상 정도를 각 등급별로 나타내는 그래프입니다. **이익도표(Gains Chart)**는 분류 모델을 적용했을 때 각 등급에 포함되는 관측치 수를 보여줍니다. 향상도 값이 클수록 해당 등급에서 모델이 랜덤 대비 더 효과적임을 의미합니다. --- --- ## 핵심 요약 & 시험 포인트 ### 혼동행렬(Confusion Matrix) | | 예측 Positive | 예측 Negative | |--|--------------|--------------| | 실제 Positive | **TP** (참 양성) | **FN** (위음성) | | 실제 Negative | **FP** (위양성) | **TN** (참 음성) | ### 주요 평가 지표 수식 | 지표 | 수식 | 의미 | |------|------|------| | **정확도** | (TP+TN)/(TP+FP+FN+TN) | 전체 중 올바른 예측 비율 | | **정밀도** | TP/(TP+FP) | 양성 예측 중 실제 양성 비율 | | **재현율(민감도)** | TP/(TP+FN) | 실제 양성 중 예측 양성 비율 | | **특이도** | TN/(FP+TN) | 실제 음성 중 예측 음성 비율 | | **F1-Score** | 2×P×R/(P+R) | 정밀도와 재현율의 조화평균 | > **시험 포인트:** ROC X축=1-특이도(FPR), Y축=민감도(TPR). AUC가 1에 가까울수록 우수한 모형입니다. --- --- ## 교차검증 (Cross-Validation) 모형의 **일반화 성능**을 신뢰성 있게 평가하기 위해 데이터를 여러 차례 나눠 검증하는 방법입니다. | 방법 | 설명 | 장단점 | |------|------|------| | **홀드아웃(Holdout)** | 훈련/테스트를 한 번 분리 (보통 7:3, 8:2) | 빠르지만 분할에 따라 편차 큼 | | **k-fold CV** | 데이터를 k개 폴드로 나눠 k번 반복 | 안정적, k=5/10이 일반적 | | **LOOCV** | n개 데이터에 대해 n번 검증 (k=n) | 편향↓, 계산 비용↑↑ | | **층화 k-fold(Stratified)** | 폴드마다 클래스 비율 유지 | 불균형 데이터에 필수 | | **부트스트랩(Bootstrap)** | 복원추출로 훈련 세트 구성, OOB로 검증 | OOB ≈ 36.8% 자동 검증 | ### k-fold 절차 1. 데이터를 k개 폴드로 균등 분할 2. 1개 폴드를 테스트, 나머지 k-1개로 학습 3. k번 반복하여 평균 성능 계산 > **시험 포인트**: k-fold에서 k=n이면 LOOCV. 클래스 불균형 시 반드시 **층화 k-fold** 사용. 부트스트랩의 OOB(Out-of-Bag) ≈ 1-(1-1/n)^n ≈ 36.8%. --- ## 추가 평가 지표 ### PR 곡선 (Precision-Recall Curve) ROC 곡선의 대안. **클래스 불균형** 시 ROC보다 적합. | 항목 | ROC 곡선 | PR 곡선 | |------|---------|---------| | X축 | 1-특이도 (FPR) | 재현율 (Recall) | | Y축 | 민감도 (TPR) | 정밀도 (Precision) | | AUC | AUROC | **AUPRC** | | 적합 | 균형 데이터 | 불균형 데이터 | > 클래스 불균형(예: 사기 거래 1%)에서는 PR 곡선의 AUPRC가 모형 성능을 더 잘 반영. ### 추가 분류 지표 | 지표 | 수식 | 특징 | |------|------|------| | **Cohen's Kappa** | (P_o - P_e)/(1 - P_e) | 우연 일치 보정 정확도 | | **MCC (Matthews CC)** | (TP·TN-FP·FN)/√... | 클래스 불균형에 강건 | | **Log Loss** | -Σ y log(p) | 확률 예측 평가, 작을수록 좋음 | ### 추천·검색 평가 지표 | 지표 | 의미 | |------|------| | **MAP (Mean Average Precision)** | 여러 쿼리의 평균 정밀도 | | **MRR (Mean Reciprocal Rank)** | 첫 정답의 역순위 평균 (1/rank) | | **NDCG** | 순위·관련도 가중 평가 | | **Hit Rate@K** | 상위 K개 중 정답 포함 비율 | ### 회귀 모형 평가 | 지표 | 수식 | 특징 | |------|------|------| | **MSE** | Σ(y-ŷ)²/n | 평균 제곱 오차 | | **RMSE** | √MSE | 단위가 원래 데이터와 같음 | | **MAE** | Σ\|y-ŷ\|/n | 평균 절대 오차, 이상치에 덜 민감 | | **MAPE** | Σ\|(y-ŷ)/y\|/n | 백분율 오차 | | **R²** | 1 - SSE/SST | 결정계수, 0~1 | > **시험 포인트**: 클래스 불균형에는 PR 곡선/MCC. 추천에는 MAP/MRR/NDCG. 회귀는 RMSE/MAE/R². --- ## 추가 핵심 개념 — 편향-분산 트레이드오프와 XAI - **편향-분산 트레이드오프(Bias-Variance Tradeoff)**: - 총 오차 = Bias² + Variance + Irreducible Error - **편향 高·분산 低 = 과소적합(Underfitting)**: 모형이 너무 단순. 훈련·테스트 모두 낮음 - **편향 低·분산 高 = 과적합(Overfitting)**: 훈련 데이터에 과도. 훈련↑ 테스트↓ - 균형 핵심. 모형 복잡도·정규화(L1·L2)·드롭아웃·앙상블로 조정. - **설명가능 AI(XAI, eXplainable AI)**: - **SHAP(SHapley Additive exPlanations)**: 게임이론의 샤플리값으로 각 변수의 기여도 계산. 전역·국소 해석 가능 - **LIME(Local Interpretable Model-agnostic Explanations)**: 예측 주변의 국소 영역을 단순 모형으로 근사해 개별 예측을 설명 - **Partial Dependence Plot(PDP)**: 한 변수가 변할 때 예측값의 평균 변화 - **Feature Importance**: 트리 기반 모형에서 변수의 분할 기여도 > **시험 핵심**: Bias-Variance Tradeoff와 과적합·과소적합의 관계, XAI의 SHAP·LIME 차이가 모형 평가 단원의 심화 포인트입니다. ### 분류 성능 지표 전부 - **정확도(Accuracy)**: (TP+TN) / 전체 - **정밀도(Precision)**: TP / (TP+FP) — Positive 예측 중 실제 Positive 비율 - **재현율(Recall) / 민감도(Sensitivity)**: TP / (TP+FN) — 실제 Positive 중 검출 비율 - **특이도(Specificity)**: TN / (TN+FP) — 실제 Negative 중 정확히 Negative 예측 비율 - **F1-score**: 2·Precision·Recall / (Precision+Recall) — 두 지표의 조화평균. 불균형 데이터에 적합 - **거짓 양성/음성(FP/FN)**: 모델이 양성으로 잘못 예측(FP, Type I) / 음성으로 잘못 예측(FN, Type II) - **분류 임계값(Threshold/Cutoff)**: 확률 분류기에서 양/음을 가르는 기준. 비용·민감도에 따라 조정 - **Kappa 통계량**: 우연 일치를 보정한 일치도 지표. 0.6 이상이면 양호 ### ROC와 AUC - **ROC 곡선**: x=1−특이도(FPR), y=민감도(TPR). 임계값에 따른 분류기 성능 곡선 - **AUC(Area Under Curve)**: ROC 아래 면적. 1에 가까울수록 우수, 0.5는 무작위 수준 ### 일반화 개념 - **편향(Bias)**: 모델이 실제 관계를 단순화하여 발생하는 오차 — 과소적합 원인 - **분산(Variance)**: 학습 데이터 변동에 모델이 민감한 정도 — 과적합 원인 - **편향-분산 트레이드오프**: 둘 중 하나를 줄이면 다른 하나가 증가. 총 오차를 최소화하는 균형점 ### 회귀 평가 지표 - **MAE(Mean Absolute Error)**: Σ|yᵢ − ŷᵢ| / n — 이상치에 강건 - **MSE(Mean Squared Error)**: Σ(yᵢ − ŷᵢ)² / n — 큰 오차에 큰 페널티 - **RMSE(Root MSE)**: √MSE — 원래 단위로 해석 가능 - **MAPE(Mean Absolute Percentage Error)**: 100·Σ|yᵢ − ŷᵢ|/|yᵢ| / n — 단위 무관, 0 근처 값에서 불안정 - **R²(결정계수)**: 1 − SSE/SST — 모형이 설명하는 변동 비율 ### 손실함수 (Loss Function) - **Cross-entropy(교차엔트로피, Log-loss)**: 분류 모델의 표준 손실 — −Σ y·log(ŷ) - **이진 교차엔트로피 vs 범주형 교차엔트로피**: 출력 차원에 따라 사용 - **Hinge Loss**: SVM의 손실함수 ### ROC 곡선의 축 - **TPR(True Positive Rate, 진양성률 = 민감도 = Recall)**: TP / (TP+FN) - **FPR(False Positive Rate, 위양성률 = 1−특이도)**: FP / (FP+TN) - ROC 곡선은 임계값을 변화시키며 (FPR, TPR) 궤적을 그림 ### 이상치 탐지 (Boxplot 기준) - **IQR(Interquartile Range)**: Q3 − Q1 - **Lower Fence**: Q1 − 1.5·IQR - **Upper Fence**: Q3 + 1.5·IQR - **Mild Outlier(약한 이상치)**: 1.5·IQR을 벗어남 - **Extreme Outlier(극단 이상치)**: 3·IQR을 벗어남 ### Garbage In, Garbage Out (GIGO) - 모델 성능은 학습 데이터의 품질에 좌우됨 — 입력이 쓰레기면 출력도 쓰레기 ### 분류 성능 차트 - **Lift Chart(이익도표·향상도 차트)**: 무작위 대비 모델이 얼마나 향상되었는지를 백분위(decile)별로 보여줌 - **Cumulative Lift**: 상위 X%만 선택했을 때 누적 향상도 - **Gain Chart(획득도표)**: 상위 X%에서 잡아내는 양성 클래스 비율 - **Response Chart**: 각 decile의 응답률 - 마케팅 캠페인·이탈 예측에서 자원 효율 의사결정에 활용 ### 정밀도-재현율 곡선 - **PR Curve(Precision-Recall Curve)**: x=Recall, y=Precision - **PR AUC / Average Precision(AP)**: PR 곡선 아래 면적 — 불균형 데이터에서 ROC AUC보다 유용 ### 추가 평가 지표 - **G-mean(Geometric Mean)**: √(Sensitivity × Specificity) — 불균형 데이터 - **Balanced Accuracy**: (Sensitivity + Specificity) / 2 - **MCC(Matthews Correlation Coefficient)**: 혼동행렬 4요소 모두 사용한 균형 지표 [−1, 1] - **Brier Score**: 예측 확률과 실제값의 MSE — 확률 보정 평가 - **Cohen's Kappa**: 우연 일치 보정 일치도 ### Multiclass 평가 평균 방식 - **Macro Average**: 각 클래스 지표의 단순 평균 - **Micro Average**: 모든 클래스 합산 후 지표 계산 - **Weighted Average**: 클래스 빈도로 가중 평균 ### 일반화와 오차 - **일반화(Generalization)**: 학습 데이터를 넘어 새로운 데이터에서도 잘 동작하는 능력 - **모형의 일반화 능력**: 좋은 모델의 핵심 지표 - **일반화 오차(Generalization Error)**: 모집단 전체에 대한 기대 오차 — 보통 추정 불가 - **경험적 오차(Empirical Error)**: 학습 데이터에 대한 평균 오차 — 측정 가능 - **시험 오차(Test Error)**: 시험 데이터의 오차 → 일반화 오차의 근사 ### 검증 방법 - **Hold-out validation**: 데이터를 한 번만 분할 - **Repeated holdout**: 여러 번 반복 분할 - **K-fold CV**: 교차검증 - **Out-of-time validation**: 시간순으로 분할 — 시계열·금융 - **Out-of-sample**: 학습에 사용하지 않은 표본 - **Backtest(백테스트)**: 과거 데이터로 미래 예측을 시뮬레이션 ### 예측 정확도 - **예측 정확도(Prediction Accuracy)**: 실제값과 예측값의 일치 정도 - 분류: Accuracy·Precision·Recall·F1 - 회귀: MAE·RMSE·MAPE ### 불균형 데이터 핸들링 - **ROS(Random Oversampling)**: 소수 클래스 무작위 복제 - **RUS(Random Undersampling)**: 다수 클래스 무작위 제거 - **Class Weight**: 손실함수에서 클래스별 가중치 부여 — 데이터 변형 없이 처리 ### 정확도 함정 - **Accuracy Paradox(정확도의 함정)**: 불균형 데이터에서 다수 클래스 예측만으로도 높은 정확도 → 무의미 - 해결: F1·MCC·G-mean 등 균형 지표 사용 ### 학습과 추론 - **학습(Training)**: 데이터로 모델 파라미터를 찾는 단계 — 시간·자원 많이 소요 - **추론(Inference)**: 학습된 모델로 새 데이터의 예측을 생성 — 빠르고 가벼움 - **재현성(Reproducibility)**: 같은 입력·코드·환경에서 같은 결과가 나와야 함 — 시드(seed) 고정·환경 기록·MLflow ### 모형의 정확도와 비교 - **모형의 정확도(Model Accuracy)**: 예측이 실제값과 일치하는 정도 — 분류는 Accuracy/F1, 회귀는 RMSE/MAE - **모형 비교**: 동일한 검증 데이터에서 평가, 통계적 비교는 McNemar·Friedman·5×2 CV 등 ### 이상치 다변량 확장 - **다변량 이상치(Multivariate Outlier)**: 개별 변수로는 정상이나 변수 결합에서 비정상 (예: 키 180cm는 정상, 몸무게 30kg도 정상이지만 함께 보면 이상) - 탐지: Mahalanobis 거리·Isolation Forest·다변량 박스플롯 ### 변수 중요도 (Feature Importance) - **Tree-based Importance(트리 기반)**: 노드 분할 시 불순도 감소량 합계 — 트리 모델의 기본 - **Permutation Importance(순열 중요도)**: 검증 셋에서 특정 변수의 값을 무작위로 섞은 후 성능 감소량 — 모델 독립적 - **SHAP**: 게임이론의 Shapley value를 ML에 적용 — 개별 예측에 대한 변수 기여도 ### 평가의 결과 표현 - **Cumulative Capture Rate(누적 포착률)**: 상위 X%에서 잡아내는 실제 양성 비율 - **PR Curve의 해석**: PR AUC가 무작위 추측 = 양성 비율 (불균형 데이터에서 자연 기준선) ### 시계열 모형 평가 - **Time Series Split**: 시간 순서를 보존한 분할 — 미래 데이터로 학습 방지 - **Walk-Forward Validation / Forward Chaining**: 학습 윈도우를 시간에 따라 전진시키며 평가 - 학습 1~100 → 예측 101~110 - 학습 1~110 → 예측 111~120 - ... 반복 - **Expanding Window vs Sliding Window**: - **Expanding**: 학습 데이터를 누적해서 증가 - **Sliding**: 학습 윈도우 크기 고정, 시작점만 이동 ### 마케팅·분류 평가 곡선 - **향상도 곡선(Lift Curve / Lift Chart)**: 무작위 대비 모델의 성능 향상 — decile별 lift 표시 - **누적 향상도(Cumulative Lift)**: 상위 X%만 선택 시 누적 향상도 - **이익 곡선(Profit Curve)**: 임계값·선택 비율에 따른 기대 이익 - **응답률 곡선(Response Curve)**: 각 decile의 응답률 — 마케팅 캠페인 ROI 분석 - **분위 분석(Decile Analysis)**: 데이터를 10분위로 나눠 각 분위의 성능 평가 - **CAP Curve(Cumulative Accuracy Profile)**: 누적 정확도 프로파일 — 무작위·완벽 모델 사이의 면적 비율로 평가 ### 활용 - 신용평가: KS Curve·Lift Chart로 변별력 측정 - 마케팅: Profit Curve로 캠페인 대상 결정 ### 완벽 분류기 지점 - **완벽 분류기(Perfect Classifier)**: TPR=1, FPR=0 — ROC 곡선의 (0, 1) 좌측 상단 - **무작위 분류기(Random Classifier)**: 대각선 (FPR=TPR), AUC=0.5 - **최악 분류기**: 대각선 아래 (FPR>TPR), AUC<0.5 — 라벨 반전하면 좋은 분류기 ### 다중 라벨 평가 - **Hamming Loss(해밍 손실)**: 잘못 예측된 라벨 비율의 평균 - **Subset Accuracy(부분집합 정확도)**: 모든 라벨이 정확히 일치한 비율 — 매우 엄격 - **Macro/Micro F1**: 클래스별 F1 평균 / 전체 F1 ### 확률 예측 평가 - **Brier Score**: Σ(ŷᵢ − yᵢ)² / n — 예측 확률과 실제 0/1 차이의 제곱평균 - 0에 가까울수록 좋음 — 확률 보정(Calibration) 평가 - **Calibration Curve(보정 곡선)**: 예측 확률 vs 실제 빈도 — 대각선에 가까울수록 잘 보정됨 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **재현율(Recall) / 민감도(Sensitivity)** — TP / (TP+FN) — 실제 Positive 중 검출 비율 - **거짓 양성/음성** — 모델이 양성으로 잘못 예측(FP, Type I) / 음성으로 잘못 예측(FN, Type II) - **분류 임계값** — 확률 분류기에서 양/음을 가르는 기준. 비용·민감도에 따라 조정 - **Kappa 통계량** — 우연 일치를 보정한 일치도 지표. 0.6 이상이면 양호 - **MAE** — Σ|yᵢ − ŷᵢ| / n — 이상치에 강건 - **MAPE** — 100·Σ|yᵢ − ŷᵢ|/|yᵢ| / n — 단위 무관, 0 근처 값에서 불안정 - **Cross-entropy** — 분류 모델의 표준 손실 — −Σ y·log(ŷ) - **Lift Chart** — 무작위 대비 모델이 얼마나 향상되었는지를 백분위(decile)별로 보여줌 - **Cumulative Lift** — 상위 X%만 선택했을 때 누적 향상도 - **Gain Chart** — 상위 X%에서 잡아내는 양성 클래스 비율 - **PR AUC / Average Precision** — PR 곡선 아래 면적 — 불균형 데이터에서 ROC AUC보다 유용 - **G-mean** — √(Sensitivity × Specificity) — 불균형 데이터 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### R 프로그래밍 기초 URL: https://adsp.todaycode.kr/study/35 태그: 빅데이터 3V/5V, 회귀분석, 시계열 분석, 군집분석, R 프로그래밍, 데이터 전처리 ## R 언어 특징 **R**은 통계 분석과 시각화에 특화된 오픈소스 프로그래밍 언어입니다. - **벡터화 연산**: 반복문 없이 벡터 단위로 연산 수행 - **오픈소스**: CRAN에서 15,000개 이상의 패키지 제공 - **통계/시각화 특화**: 회귀분석, 군집분석, 시계열 분석 등 내장 ## 기본 데이터 타입 | 타입 | 설명 | 예시 | |------|------|------| | **벡터(Vector)** | 동일 타입 원소의 1차원 집합 | c(1, 2, 3) | | **행렬(Matrix)** | 동일 타입의 2차원 구조 | matrix(1:6, nrow=2) | | **데이터프레임(Data Frame)** | 열마다 다른 타입 허용, 표 형태 | data.frame() | | **리스트(List)** | 서로 다른 타입 원소 허용 | list(1, "a", TRUE) | | **팩터(Factor)** | 범주형 변수, 레벨 보유 | factor(c("남","여")) | ## 주요 패키지 - **ggplot2**: 그래머 오브 그래픽스 기반 시각화 - **dplyr**: 데이터 조작 및 변환 - **tidyr**: 데이터 구조 정리(wide↔long 변환) - **caret**: 머신러닝 모델 학습/평가 통합 ## 기본 문법 - **변수 할당**: `x <- 10` (화살표 연산자) - **파이프 연산자**: `%>%` (magrittr/dplyr), 왼쪽 결과를 오른쪽 함수의 첫 인자로 전달 - **dplyr 주요 함수**: `filter()` 행 필터링, `select()` 열 선택, `mutate()` 변수 생성, `group_by()` 그룹화, `summarise()` 집계 ## R 기본 자료형 (Atomic Types) | 자료형 | 설명 | 예시 | |------|------|------| | **numeric** | 정수·실수 | 1, 3.14 | | **integer** | 정수 (L 접미사) | 5L | | **character** | 문자열 | "ADsP" | | **logical** | 논리형 | TRUE, FALSE | | **complex** | 복소수 | 1+2i | ## 결측값(Missing Value) 4종류 | 표현 | 의미 | 발생 예 | |------|------|---------| | **NA** | Not Available, 결측값 | 응답 누락 | | **NULL** | 객체 자체가 없음 | 빈 리스트 원소 | | **NaN** | Not a Number, 정의 불가 | 0/0, log(-1) | | **Inf / -Inf** | 양·음 무한대 | 1/0 | > 결측 검사: `is.na()`, `is.null()`, `is.nan()`, `is.infinite()`. `NA`는 `is.na()=TRUE`이지만 `NaN`도 `is.na()=TRUE`임에 주의. ## apply 계열 함수 (반복문 대체) | 함수 | 입력 | 출력 | 용도 | |------|------|------|------| | **apply(X, MARGIN, FUN)** | 행렬/배열 | 벡터/행렬 | 행(1)·열(2) 단위 적용 | | **sapply(X, FUN)** | 벡터/리스트 | 벡터/행렬 (단순화) | 각 원소에 함수 적용 | | **lapply(X, FUN)** | 벡터/리스트 | 리스트 | 결과를 리스트로 보존 | | **mapply(FUN, ...)** | 다중 인자 | 벡터/행렬 | sapply의 다변수 버전 | | **tapply(X, INDEX, FUN)** | 벡터+그룹 | 그룹별 집계 | group_by + summarise | > **시험 포인트**: `apply(m, 1, sum)` = 행 합계, `apply(m, 2, sum)` = 열 합계. 결과 자료구조 차이(sapply=벡터, lapply=리스트)가 자주 출제됩니다. ### apply 함수 계열 - **apply(X, MARGIN, FUN)**: 행렬·배열에 함수 적용. MARGIN=1 행, 2 열 - **sapply(X, FUN)**: 리스트·벡터에 적용, 가능하면 벡터·행렬로 단순화 반환 - **lapply(X, FUN)**: 리스트로 반환 - **vapply(X, FUN, FUN.VALUE)**: sapply에 반환형 명시 — 더 안전 - **mapply(FUN, ...)**: 다중 인자 sapply - **tapply(X, INDEX, FUN)**: 그룹별 함수 적용 ### 자료구조와 변환 - **vector / list / matrix / array / data.frame / factor**: R의 6대 자료형 - **array**: 다차원 배열 — array(data, dim=c(...)) - **factor**: 범주형 변수 — 수준(levels) 관리 - **cbind / rbind**: 열·행 결합 - **merge**: 데이터프레임 조인 (by 기준) - **subset**: 조건으로 부분 추출 ### dplyr 핵심 동사 - **filter()**: 행 선택, **select()**: 열 선택 - **mutate()**: 새 변수 생성, **summarise()**: 요약 통계 - **group_by()**: 그룹화, **arrange()**: 정렬 - **%>% (pipe)**: 왼쪽 결과를 오른쪽 함수의 첫 인자로 전달 - **plyr의 ddply()**: 데이터프레임을 그룹화하여 함수 적용 후 데이터프레임 반환 - **ldply / dlply / llply**: 입력/출력 형태별 변형 ### I/O와 패키지 관리 - **read.csv / read.table / readr::read_csv**: 파일 읽기 - **write.csv / write.table**: 파일 쓰기 - **install.packages("패키지명")**: 패키지 설치 - **library(패키지명)**: 패키지 로드 ### 통계·모델 함수 - **lm() / glm() / aov()**: 선형·일반화선형·분산분석 모형 - **predict()**: 예측 - **summary() / str() / head() / tail()**: 객체 요약·구조·앞뒤 미리보기 - **scale()**: 표준화, **prcomp() / princomp()**: PCA, **factanal()**: 요인분석 - **kmeans() / hclust() / cutree()**: 군집분석 - **t.test / cor.test / chisq.test / wilcox.test / shapiro.test**: 통계 검정 ### R 조건·논리 함수 - **ifelse(조건, 참값, 거짓값)**: 벡터의 각 원소에 조건을 적용해 결과 벡터 반환 — 벡터화 작동 - 예: `ifelse(x > 0, "양수", "비양수")` - 일반 `if-else` 문은 단일 논리값에만 적용 - **dplyr::case_when()**: 다중 조건을 처리하는 더 표현력 있는 대안 - `case_when(x > 0 ~ "pos", x < 0 ~ "neg", TRUE ~ "zero")` ### R SQL 인터페이스 - **sqldf 패키지**: 데이터프레임에 직접 SQL 쿼리 실행 - 예: `sqldf("SELECT * FROM df WHERE age > 30 ORDER BY name")` - 내부적으로 SQLite 사용 — DB 경험자에 친숙 - 대용량은 느림, 비교: dplyr이 R 친화적·빠름 ### tidyverse 생태계 - **tidyverse**: 일관된 철학으로 만들어진 R 패키지 모음 (Hadley Wickham) - **dplyr**: 데이터 조작 (filter·select·mutate·summarise·group_by·arrange) - **tidyr**: 데이터 정돈 (pivot_longer·pivot_wider·separate·unite) - **ggplot2**: 그래픽 문법 시각화 - **readr**: 파일 읽기 (read_csv·read_tsv) - **stringr**: 문자열 처리 - **lubridate**: 날짜·시간 처리 - **forcats**: 범주형 변수 - **purrr**: 함수형 프로그래밍 ### 고성능 R 패키지 - **data.table 패키지**: 대용량 데이터 빠른 처리 — `DT[i, j, by]` 문법, 인메모리 최적화 - **reshape2**: melt(긴 형태)·cast(넓은 형태) — tidyr 이전 표준 - **plyr 패키지**: 분할-적용-결합(Split-Apply-Combine)의 시초 — ddply·llply·dlply - **Rcpp / RcppArmadillo**: R에서 C++ 함수 호출 — 성능 가속 - **foreach + doParallel**: 병렬 반복 처리 - **require() / library()**: 패키지 로드 — require는 실패해도 경고만, library는 오류 발생 ### 데이터 변형 (Reshape) - **melt(reshape2/data.table)**: Wide 형식을 Long 형식으로 변환 (열을 행으로 펼침) - 예: 연도별 컬럼 → 연도 컬럼 + 값 컬럼 - **dcast()**: Long → Wide 변환 (cast) - **pivot_longer() / pivot_wider() (tidyr)**: 최신 dplyr 계열 reshape 함수 - **gather() / spread() (구 tidyr)**: 이전 버전의 reshape 함수 ### Wide vs Long 데이터 - **Wide 형식**: 변수마다 컬럼 (한 행에 여러 측정값) — 사람이 읽기 쉬움 - **Long 형식**: 측정값마다 행 (key-value 구조) — ggplot2·통계 분석에 적합 - ML/시각화는 Long 형식을 선호 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **vapply** — sapply에 반환형 명시 — 더 안전 - **array** — 다차원 배열 — array(data, dim=c(...)) - **factor** — 범주형 변수 — 수준(levels) 관리 - **filter()** — 행 선택, **select()**: 열 선택 - **mutate()** — 새 변수 생성, **summarise()**: 요약 통계 - **group_by()** — 그룹화, **arrange()**: 정렬 - **%>%** — 왼쪽 결과를 오른쪽 함수의 첫 인자로 전달 - **plyr의 ddply()** — 데이터프레임을 그룹화하여 함수 적용 후 데이터프레임 반환 - **require() / library()** — 패키지 로드 — require는 실패해도 경고만, library는 오류 발생 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터마트와 데이터 전처리 URL: https://adsp.todaycode.kr/study/36 태그: 기억 용량 단위, 빅데이터, 기술통계, 시계열 분석, 인공신경망, R 프로그래밍, 데이터 전처리, 탐색적 분석, 데이터 마트, 이상치·결측, 데이터 웨어하우스, SQL ## 데이터마트 정의 **데이터마트(Data Mart)**는 특정 분석 목적에 맞게 가공·정제된 데이터 집합입니다. 데이터 웨어하우스(전사 통합)와 달리 부서·주제별로 분리된 소규모 데이터 저장소입니다. | 구분 | 데이터마트 | 데이터 웨어하우스 | |------|-----------|------------------| | 범위 | 부서/주제 단위 | 전사 통합 | | 크기 | 소규모 (GB) | 대규모 (TB~PB) | | 목적 | 특정 분석 | 통합 리포팅 | ## 데이터 전처리 단계 1. **결측값 처리**: 누락 데이터 처리 2. **이상값 처리**: 비정상적인 값 탐지 및 처리 3. **정규화/표준화**: 변수 스케일 통일 4. **변수 변환**: 파생변수 생성, 인코딩 ## 결측값 처리 방법 - **완전 제거(Listwise Deletion)**: 결측 행 전체 삭제 - **평균/중앙값 대체**: 연속형 변수에 평균·중앙값 삽입 - **회귀 대체**: 다른 변수로 결측값 예측 - **다중 대체(Multiple Imputation)**: 여러 번 대체 후 결과 통합 ## 이상값 탐지 - **IQR 기준**: Q1-1.5×IQR 미만, Q3+1.5×IQR 초과 - **Z-score**: |Z| > 3이면 이상값 - **Boxplot**: 수염(whisker) 범위 벗어난 점 ## 정규화 - **Min-Max 정규화**: (x - min) / (max - min) → [0, 1] 범위 - **Z-score 표준화**: (x - μ) / σ → 평균 0, 표준편차 1 **파생변수**: 기존 변수를 조합·변환하여 새롭게 생성한 변수 (예: 나이 → 연령대) --- ## EDW(Enterprise Data Warehouse) vs 데이터마트(DM) | 구분 | EDW | DM | |------|-----|-----| | 범위 | **전사 통합** (모든 부서/시스템) | 부서·주제별 부분 | | 크기 | TB ~ PB | GB 단위 | | 사용자 | 경영진, 분석가 | 특정 부서·팀 | | 구축 | 장기·고비용 | 단기·저비용 | | 데이터 모델 | 정규화/스타 스키마 | 비정규화/스타 스키마 | ### ETL vs ELT - **ETL**: 추출(Extract) → **변환(Transform)** → 적재(Load), 전통적 DW - **ELT**: 추출 → 적재 → 변환, 클라우드/빅데이터 환경 ### DW 스키마 종류 | 스키마 | 특징 | |--------|------| | **스타 스키마(Star)** | 중앙 팩트 테이블 + 비정규화된 차원 테이블 | | **스노우플레이크(Snowflake)** | 차원 테이블이 정규화되어 분기 | | **팩트 콘스텔레이션** | 여러 팩트 테이블을 차원으로 연결 | ## 데이터 변환 — reshape & JOIN ### reshape - **wide → long(melt)**: 여러 열을 행으로 펼침 - **long → wide(cast/dcast)**: 행을 열로 모음 - R: `reshape2::melt/dcast`, `tidyr::pivot_longer/pivot_wider` ### JOIN 4종 (분석에 자주 사용) | JOIN | 결과 | |------|------| | **INNER JOIN** | 양쪽 모두에 매칭되는 행 | | **LEFT JOIN** | 왼쪽 테이블 전체 + 오른쪽 매칭 | | **RIGHT JOIN** | 오른쪽 전체 + 왼쪽 매칭 | | **FULL OUTER JOIN** | 양쪽 모두 (매칭 + 미매칭) | > **시험 포인트**: EDW는 전사 통합, DM은 부서별. 데이터마트는 EDW의 부분집합으로 볼 수 있음. --- ## 결측값 발생 메커니즘 — MCAR/MAR/MNAR | 메커니즘 | 영문 | 설명 | 처리 | |---------|------|------|------| | **MCAR** | Missing **Completely** At Random | 결측이 완전 무작위 (다른 변수와 무관) | 단순 제거·평균 대체로 충분 | | **MAR** | Missing At Random | 다른 **관측된** 변수에 의존 (예: 남성이 체중 응답 회피) | 회귀 대체, 다중 대체 | | **MNAR** | Missing **Not** At Random | **결측값 자체**에 의존 (예: 고소득자의 소득 미응답) | 모델링 어려움, 도메인 전문 지식 | > **시험 포인트**: MCAR는 무조건 무작위, MAR는 다른 관측 변수에 의존, MNAR는 결측값 자체에 의존. ## 머신러닝 기반 이상치 탐지 | 기법 | 원리 | 특징 | |------|------|------| | **Isolation Forest** | 랜덤 분할로 데이터 격리, 평균 분리 깊이 사용 | 이상치는 적은 분할로 격리됨 | | **LOF (Local Outlier Factor)** | 지역 밀도 비교 | 주변보다 밀도 낮으면 이상치 | | **One-Class SVM** | 정상 데이터 경계 학습 | 경계 밖 = 이상치 | | **DBSCAN** | 밀도 기반 군집의 노이즈 | 군집에 속하지 않는 점이 이상치 | | **Autoencoder** | 재구성 오차 큰 점 | 신경망 기반 | ### 통계 vs ML 기반 비교 - **통계 기반(Z-score, IQR)**: 단변량, 정규성 가정 - **ML 기반(Isolation Forest, LOF)**: 다변량, 비선형 패턴 가능 ## EDA 시각화 차트 종류 | 차트 | 용도 | 데이터 유형 | |------|------|------------| | **히스토그램(Histogram)** | 분포 확인 | 연속형 단변량 | | **박스플롯(Box Plot)** | 분포·이상치·사분위수 | 연속형 | | **바이올린 플롯(Violin)** | 박스플롯 + 분포 모양 | 연속형 | | **산점도(Scatter Plot)** | 두 변수 관계 | 연속형 양변량 | | **히트맵(Heatmap)** | 상관행렬 시각화 | 행렬 | | **막대 그래프(Bar)** | 범주별 빈도/평균 | 범주형 | | **파이 차트(Pie)** | 구성 비율 | 범주형 (5개 이하 권장) | | **선 그래프(Line)** | 시계열 추세 | 시계열 | | **모자이크 플롯(Mosaic)** | 두 범주형 변수 관계 | 범주형 양변량 | ### 그래프 선택 가이드 - 분포 → 히스토그램, 박스플롯 - 관계 → 산점도, 히트맵 - 비교 → 막대 그래프 - 추세 → 선 그래프 - 구성 → 파이 차트, 누적 막대 > **시험 포인트**: 히스토그램은 연속형 분포, 박스플롯은 사분위수+이상치, 산점도는 두 변수 관계, 히트맵은 상관행렬 시각화. --- ## 추가 핵심 개념 — 결측 메커니즘과 SMOTE - **결측 메커니즘 3종(Rubin)**: - **MCAR(Missing Completely At Random)**: 결측 여부가 어떤 변수와도 무관. 완전 무작위 - **MAR(Missing At Random)**: 결측 여부가 관측된 다른 변수에만 의존 - **MNAR(Missing Not At Random)**: 결측 여부가 결측값 자체에 의존(처리 가장 어려움). 예: 고소득자가 소득 응답 회피 - **다중대치법(Multiple Imputation, MI)**: 결측값마다 m개(보통 5~10개)의 대체값을 생성해 m개의 완전 데이터셋을 만들고, 각각 분석한 결과를 Rubin's Rules로 통합. 단일 대치보다 결측의 불확실성을 모형 추정의 분산에 반영. 도구: R `mice`, Python `sklearn IterativeImputer`. - **클래스 불균형 해결 — SMOTE·언더·오버샘플링**: - **언더샘플링(Undersampling)**: 다수 클래스 무작위 제거. 정보 손실 위험 - **오버샘플링(Oversampling)**: 소수 클래스 단순 복제. 과적합 위험 - **SMOTE(Synthetic Minority Over-sampling Technique)**: 소수 클래스 샘플과 k-최근접 이웃 사이를 보간(interpolation)하여 합성 샘플 생성. 단순 복제보다 과적합 위험↓. 변형: Borderline-SMOTE, ADASYN, SMOTE-ENN. > **시험 핵심**: MCAR·MAR·MNAR의 차이와 SMOTE의 보간 방식이 빈출 포인트입니다. ### 이상치(Outlier) 처리 - **이상치 탐지 방법**: - **통계적**: Z-score (|z|>3), IQR (Q1−1.5·IQR ~ Q3+1.5·IQR 밖) - **시각적**: 박스플롯·산점도 - **모델 기반**: Isolation Forest·LOF(Local Outlier Factor) - **이상치 처리**: 제거·치환(평균·중앙값)·구간화·Winsorization·로그 변환 - **주의**: 진짜 신호일 수도 있으므로 도메인 확인 필수 ### 결측치(Missing Value) 메커니즘 - **MCAR(Missing Completely At Random)**: 완전 무작위 결측 — 통계적 영향 거의 없음 - **MAR(Missing At Random)**: 관찰된 변수에 의존 — 다중대체로 처리 가능 - **MNAR(Missing Not At Random)**: 결측 자체가 결측값에 의존 — 가장 까다로움 - **처리 방법**: 삭제·평균/중앙값/최빈값 대체·KNN 대체·다중대체(MICE) ### 특성 공학 (Feature Engineering) - **파생변수 생성**: 기존 변수의 조합·집계·시간 추출 등으로 새 변수 만들기 - **특성 선택(Feature Selection)**: 정보량이 높은 변수만 선별 — Filter(상관·χ²) / Wrapper(전진·후진) / Embedded(Lasso·Tree importance) - **특성 변환**: 표준화·정규화·로그·Box-Cox·Yeo-Johnson - **인코딩**: 원-핫·레이블·타깃 인코딩 - **구간화(Binning)**: 연속형을 구간으로 이산화 (등간격·등빈도) ### 탐색적 데이터 분석 (EDA) - **EDA(Exploratory Data Analysis)**: Tukey가 제안 — 통계 모델링 전에 데이터의 분포·관계·이상치를 시각·요약으로 탐색 - **EDA의 4대 활동**: - **저항성(Resistance)**: 이상치에 강건한 통계량 사용 (중앙값·MAD) - **잔차해석(Residual)**: 모형 적합 후 잔차로 패턴 확인 - **재표현(Re-expression)**: 변수 변환(로그·제곱근·역수)으로 정규성·선형성 확보 - **그래프 표현(Display)**: 박스플롯·히스토그램·산점도 등 ### 변환 종류 - **표준화(Standardization, z-정규화)**: (x − μ) / σ — 평균 0, 표준편차 1 - **Min-Max 정규화**: (x − min) / (max − min) — [0, 1] 범위 - **로그 정규화**: 오른쪽으로 치우친 분포를 대칭화 ### 결측치 대체 (Imputation) 방법 - **단순 대체**: 평균·중앙값·최빈값 — 분산 과소추정 - **회귀 대체(Regression Imputation)**: 다른 변수로 회귀모형 학습 후 결측 예측 — 결정론적 대체 - **확률적 대체**: 회귀 대체에 무작위 잔차 추가 — 분산 보존 - **KNN 대체**: 가까운 k개 이웃의 값 평균/최빈값으로 대체 - **다중대체(MICE)**: 여러 대체 데이터셋을 만들어 분석 후 결합 — 분산 추정 보정 - **EM 알고리즘**: 우도 기반 결측치 추정 ### 데이터 표준화·정제 - **Data Standardization(데이터 표준화)**: 코드·명명·도메인 규칙 표준화 - **데이터 정제(Refinement / Cleansing)**: 오류·중복·이상치 처리 - **요약 변수(Summary Variable)**: 그룹별 통계량을 새 변수로 생성 (고객별 평균 구매액 등) ### 데이터 품질 6대 차원 - **정확성(Accuracy)**: 실제 값과의 일치 정도 - **완전성(Completeness)**: 누락 없이 모든 값이 채워짐 - **일관성(Consistency)**: 동일 데이터가 여러 위치에서 동일하게 표현 - **적시성(Timeliness)**: 의사결정 시점에 필요한 데이터가 준비됨 - **유효성(Validity)**: 정의된 형식·범위·도메인 준수 - **유일성(Uniqueness)**: 중복 없는 단일 표현 - **신선도(Freshness)**: 최신 데이터로 유지 ### 데이터 모델링 3단계 - **개념적 모델(Conceptual Model)**: 비즈니스 관점의 ER 다이어그램 - **논리적 모델(Logical Model)**: 정규화·관계·키 정의 - **물리적 모델(Physical Model)**: 실제 DBMS 구현 (인덱스·파티션·테이블스페이스) ### ER 모델 - **ER(Entity-Relationship) 모델**: 개체·속성·관계로 데이터 구조 표현 - **ERD(개체-관계 다이어그램)**: ER 모델을 시각화한 다이어그램 - **개체(Entity) / 속성(Attribute) / 관계(Relationship)**: ER의 3대 요소 ### 데이터 누수 (Data Leakage) - **데이터 누수(Data Leakage)**: 학습 시점에 알 수 없어야 할 정보가 모델에 흘러들어 비현실적으로 높은 성능을 보이는 현상 - **종류**: - **Look-ahead bias**: 미래 정보를 과거에 사용 - **타깃 누수**: 타깃 변수와 직접 파생된 특성이 입력에 포함 - **전처리 누수**: 전체 데이터로 스케일링·인코딩 후 분할 → 시험 정보가 학습에 유출 - **방지**: 데이터를 먼저 분할 → 학습 데이터로만 전처리 파라미터 계산 → 적용 ### ETL 절차 - **데이터 추출(Extract)**: 원천 시스템에서 데이터 가져오기 - **데이터 변환(Transform)**: 정제·표준화·계산 - **데이터 적재(Load)**: 목적 시스템(DW·DM)에 저장 - **ETL vs ELT**: 변환 시점의 차이 — ELT는 적재 후 DW에서 변환 (클라우드·빅데이터에 적합) - **변환 규칙(Transformation Rule)**: 매핑·집계·필터링·조인 규칙 명세 ### 분석 기법 큰 분류 - **통계 기법**: 기술/추론 통계 — 평균·분산·검정·회귀 - **머신러닝 기법**: 지도/비지도/강화학습 알고리즘 - **딥러닝 기법(DL)**: 다층 신경망·CNN·RNN·Transformer - **탐색 기법(EDA)**: 시각화·요약을 통한 패턴 발견 ### 데이터 수명주기 (Data Lifecycle) - **데이터 수명주기 관리(Data Lifecycle Management, DLM)**: 생성→수집→저장→사용→공유→보관→폐기까지 단계별 정책 적용 - 각 단계에서 보안·품질·접근 권한·보존 기간이 다름 - GDPR·개인정보보호법은 명시적 폐기 의무를 요구 ### 가공의 종류 - **데이터 정제(Cleansing)**: 오류·중복·결측 처리 - **데이터 변환(Transformation)**: 형식·단위·스케일 변환 - **데이터 통합(Integration)**: 다중 소스 결합 - **데이터 축소(Reduction)**: 차원·표본·도수 축소 - **데이터 이산화(Discretization)**: 연속 → 범주 - **데이터 표준화(Standardization)**: 명명·코드·도메인 표준 ### 분산의 분해 - **Common Variance(공통 분산)**: 여러 변수가 공유하는 분산 — 요인분석의 핵심 - **Unique Variance(고유 분산)**: 특정 변수에만 있는 분산 - **Specific Variance(특수 분산)**: 변수 고유의 안정적 분산 - **Error Variance(오차 분산)**: 측정 오차로 인한 분산 - 요인분석: Total = Common + Unique - **공통성(Communality, h²)**: 변수의 분산 중 공통 요인이 설명하는 비율 ### 재현 가능한 연구 - **Reproducible Research(재현가능 연구)**: 코드·데이터·환경을 함께 제공해 다른 연구자가 같은 결과를 재현할 수 있게 하는 연구 방법 - 핵심 요소: 버전 관리(Git)·환경(Docker·conda)·시드 고정·문서화 ### 추가 스케일링 방법 - **Robust Scaler(강건 스케일러)**: 중앙값과 IQR로 스케일링 - x' = (x − median) / IQR - 이상치에 강건 — 평균·표준편차에 의존하는 StandardScaler·MinMax보다 우수 - 사용: 이상치가 많은 분포·꼬리가 두꺼운 분포 - **MaxAbs Scaler**: x' = x / max(|x|) — 부호 유지·희소 데이터 적합 - **Power Transformer**: Box-Cox(양수만) / Yeo-Johnson(전체) — 정규성 확보 ### 데이터 큐레이션 - **Data Curation(데이터 큐레이션)**: 데이터의 가치를 높이는 일련의 활동 - 수집·정리·정제·통합·메타데이터 부여·접근성 향상 - 도서관 사서의 역할과 유사 — 데이터 자산화의 핵심 - **Data Wrangling / Munging(데이터 정돈)**: 분석 가능한 형태로 가공 ### Simple Imputation (단순 대체) - **Simple Imputation(단순 대체)**: 결측치를 평균·중앙값·최빈값으로 일괄 대체 - 장점: 구현 간단, 빠름 - 단점: - 분산 과소추정 - 변수 간 관계 왜곡 - 이상치 영향 (평균 대체 시) - 권장: 결측 비율 5% 미만에만 사용, 비율 높으면 MICE·KNN·EM 대체 권장 ### 메타정보 - **메타정보(Meta-information) / 메타데이터(Metadata)**: 데이터에 관한 데이터 - 반정형 데이터의 특징: **자기 기술적 메타정보 포함**(Self-describing) — JSON·XML - 메타정보가 풍부할수록 데이터 카탈로그·검색·이해가 쉬워짐 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **이상치 탐지 방법** — **통계적**: Z-score (|z|>3), IQR (Q1−1.5·IQR ~ Q3+1.5·IQR 밖) - **이상치 처리** — 제거·치환(평균·중앙값)·구간화·Winsorization·로그 변환 - **파생변수 생성** — 기존 변수의 조합·집계·시간 추출 등으로 새 변수 만들기 - **특성 선택** — 정보량이 높은 변수만 선별 — Filter(상관·χ²) / Wrapper(전진·후진) / Embedded(Lasso·Tree … - **특성 변환** — 표준화·정규화·로그·Box-Cox·Yeo-Johnson - **구간화** — 연속형을 구간으로 이산화 (등간격·등빈도) - **EDA의 4대 활동** — **저항성(Resistance)**: 이상치에 강건한 통계량 사용 (중앙값·MAD) - **재표현** — 변수 변환(로그·제곱근·역수)으로 정규성·선형성 확보 - **타깃 누수** — 타깃 변수와 직접 파생된 특성이 입력에 포함 - **딥러닝 기법** — 다층 신경망·CNN·RNN·Transformer - **Reproducible Research** — 코드·데이터·환경을 함께 제공해 다른 연구자가 같은 결과를 재현할 수 있게 하는 연구 방법 - **MaxAbs Scaler** — x' = x / max(|x|) — 부호 유지·희소 데이터 적합 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 텍스트 마이닝 URL: https://adsp.todaycode.kr/study/37 태그: 인공신경망, 데이터 전처리, 판별분석, 텍스트 마이닝 ## 텍스트 마이닝 정의 **텍스트 마이닝(Text Mining)**은 비정형 텍스트 데이터에서 유용한 정보와 패턴을 추출하는 기술입니다. ## 전처리 단계 1. **토크나이징(Tokenizing)**: 텍스트를 단어/문장 단위로 분리 2. **불용어 제거(Stopword Removal)**: '은/는/이/가' 등 의미 없는 단어 제거 3. **어간 추출(Stemming)**: 단어를 기본형으로 변환 4. **품사 태깅(POS Tagging)**: 명사·동사·형용사 등 품사 분류 5. **형태소 분석**: 한국어 처리의 핵심, 단어를 형태소 단위로 분리 ## 주요 기법 | 기법 | 설명 | |------|------| | **TF-IDF** | 단어 빈도(TF) × 역문서 빈도(IDF) — 문서 내 핵심 단어 추출 | | **LDA** | Latent Dirichlet Allocation — 잠재 토픽 모델링 | | **감성 분석** | 텍스트의 긍정/부정/중립 감성 분류 | | **워드클라우드** | 단어 빈도에 비례한 크기로 시각화 | ## TF-IDF 개념 - **TF(Term Frequency)**: 특정 문서 내 단어 등장 횟수 - **IDF(Inverse Document Frequency)**: 전체 문서 중 해당 단어가 등장하는 문서의 역수(log 적용) - **TF-IDF**: 해당 문서에는 자주 나오지만 다른 문서에는 드문 단어를 핵심 키워드로 판별 ## 활용 사례 - SNS 여론 분석, 고객 리뷰 감성 분석, 뉴스 토픽 분류, 챗봇 인텐트 분류 --- ## 워드 임베딩 (Word Embedding) 단어를 **저차원 실수 벡터**로 표현하여 의미적 유사성을 포착. | 기법 | 등장 | 특징 | |------|------|------| | **Word2Vec** (2013, Google) | 신경망 기반 | CBOW(주변→중심), Skip-gram(중심→주변) | | **GloVe** (2014, Stanford) | 전역 통계 + 로컬 컨텍스트 | 동시발생 행렬 분해 | | **FastText** (2016, Facebook) | 부분 단어(subword) 활용 | 미등록 단어(OOV) 강건, 형태론 풍부 언어 적합 | | **BERT** (2018, Google) | Transformer 기반 양방향 | 문맥 의존 임베딩, 사전학습 모델 | ### Word2Vec의 마법 - king - man + woman ≈ queen - Paris - France + Italy ≈ Rome - 단어 의미를 벡터 공간의 방향으로 표현 ### 전통 기법 vs 워드임베딩 | 기법 | 차원 | 의미 포착 | |------|------|----------| | **BoW (Bag of Words)** | 어휘 크기 (수만~수십만) | 단순 빈도 | | **TF-IDF** | 어휘 크기 | 문서 내 중요도 | | **Word2Vec/GloVe** | 100~300 (저차원) | 의미적 유사성 | | **BERT (문맥 임베딩)** | 768~1024 | 문맥 의존 의미 | ### LDA vs BERT (텍스트 모델링) - **LDA (Latent Dirichlet Allocation)**: 토픽 모델링, 문서별 토픽 분포 - **BERT**: 문맥 임베딩, 분류·NER·QA 다목적 > **시험 포인트**: Word2Vec의 두 모델(CBOW, Skip-gram), 임베딩의 핵심은 "의미적 유사성을 벡터 거리로". BERT는 사전학습+미세조정 패러다임. --- ## 추가 핵심 개념 — 토큰화·임베딩·정규화 - **토큰화(Tokenization)**: 텍스트를 의미 단위(단어·서브워드·문자)로 분할. 영어는 공백 기준, 한국어는 형태소 분석 필수. - **형태소 분석(Morphological Analysis)**: 한국어는 교착어로 어미·조사가 발달해 단어를 의미의 최소 단위(형태소)로 분리하고 품사(POS)를 태깅. 도구: KoNLPy(Mecab·Kkma·Komoran·Hannanum·Okt). - **표제어 추출(Lemmatization)**: 'studies', 'studying' → 'study' 사전 형태로 환원. 정확하지만 느림. - **스테밍(Stemming)**: 어미 제거로 어간 추출. 규칙 기반(Porter Stemmer)으로 빠르나 결과가 사전 단어가 아닐 수 있음. - **TF-IDF**: TF(문서 내 빈도) × IDF(log(전체 문서 수 / 단어 등장 문서 수)). 흔한 단어(the·이다) 가중치↓, 특정 문서 핵심어 가중치↑. - **Word2Vec / BERT / GPT**: 단어·문장을 밀집 벡터로 임베딩하는 신경망. 의미·문맥 표현. BERT는 양방향 Transformer 인코더, GPT는 단방향 디코더. > **시험 핵심**: 토큰화·형태소·표제어·스테밍의 차이와 TF-IDF의 IDF 가중치 의미가 텍스트 마이닝 단원의 빈출입니다. ### 텍스트 전처리 - **코퍼스(Corpus)**: 분석 대상 문서 집합 - **토큰화(Tokenization)**: 텍스트를 단어·문장 단위로 분리 - **어간 추출(Stemming)**: 어미 제거 — 빠르나 부정확 (running → run) - **표제어 추출(Lemmatization)**: 사전형으로 변환 — 정확하나 느림 (better → good) - **불용어(Stopword)**: 분석에 도움 안 되는 빈출어 (그, 의, the, is) — 제거 대상 - **N-gram**: 연속된 N개 토큰을 하나의 단위로 처리 (bi-gram, tri-gram) ### 표현(Representation) - **BoW(Bag of Words)**: 단어 빈도 벡터, 순서 무시 - **TF-IDF**: 단어 빈도(TF) × 역문서빈도(IDF) — 흔한 단어 가중치 ↓ - **워드 임베딩(Word Embedding)**: 단어를 밀집 벡터로 표현 - **Word2Vec**: CBOW(주변→중심), Skip-gram(중심→주변) - **GloVe**: 전역 단어 공기행렬 기반 ### 토픽 모델링 - **LDA(Latent Dirichlet Allocation)**: 문서가 여러 토픽의 혼합이고 토픽이 여러 단어의 혼합이라는 생성모형 — 비지도 토픽 추출 ### 키워드 추출 - **키워드 추출(Keyword Extraction)**: 문서의 핵심 단어 자동 식별 - **TF-IDF 기반**: 점수 상위 단어 선택 - **TextRank**: PageRank를 단어 그래프에 적용 - **RAKE(Rapid Automatic Keyword Extraction)**: 구문 단위 추출 - **YAKE**: 통계적 특징 기반 비지도 키워드 추출 ### 텍스트 유사도 - **코사인 유사도(Cosine Similarity)**: 두 벡터의 사잇각 코사인 — [−1, 1] 범위, 1에 가까울수록 유사 - 식: cos(θ) = (A·B) / (‖A‖·‖B‖) - 문서 길이 영향이 작아 텍스트 분야에서 표준 - **자카드 유사도(Jaccard)**: |A∩B| / |A∪B| — 집합 기반 - **유클리드 거리·맨해튼 거리**: 거리 기반(작을수록 유사) ### 형태소·품사 - **형태소 분석**: 단어를 의미 최소 단위(형태소)로 분리 - **POS Tagging(품사 태깅)**: 각 토큰의 품사를 부여 (명사·동사·형용사 등) - **정규표현식(Regex)**: 패턴 기반 텍스트 추출·치환 도구 ### 행렬 표현 - **DTM(Document-Term Matrix, 문서-단어 행렬)**: 행=문서, 열=단어, 값=빈도 또는 TF-IDF - **TDM(Term-Document Matrix)**: DTM의 전치 — 행=단어, 열=문서 ### 잠재의미분석 - **LSA(Latent Semantic Analysis, 잠재의미분석)**: DTM에 SVD를 적용해 차원 축소 → 의미적으로 가까운 문서·단어 발견 - **LSI(Latent Semantic Indexing)**: LSA의 정보검색 응용 ### 감성 분석 (Sentiment / Opinion Mining) - **감성 사전(Sentiment Lexicon)**: 단어에 긍정/부정 점수가 부여된 사전 (예: SentiWordNet·KOSAC) - **오피니언 마이닝(Opinion Mining)**: 텍스트에서 의견·감정·태도 추출 - **극성(Polarity)**: 긍정·부정·중립 분류 - **속성 기반 감성분석(ABSA)**: 제품의 각 속성별 감성 (배터리=긍정, 디자인=부정) ### Bag-of-Words 모델 - **Bag-of-Words(BoW)**: 단어의 순서와 문법을 무시하고 빈도만 사용하는 문서 표현 - 단순하지만 강력 — 분류·감성분석의 기본 표현 - **TF(Term Frequency)**: 특정 단어가 한 문서에 등장한 횟수 - **DF(Document Frequency)**: 특정 단어가 등장한 문서 수 - **IDF(Inverse Document Frequency)**: log(N/DF) — 흔한 단어 페널티 ### 정보 검색 (Information Retrieval) - **정보 검색(IR)**: 대량 문서에서 사용자 질의에 맞는 문서 찾기 — 검색엔진의 핵심 - 평가 지표: Precision@k, Recall@k, MAP(Mean Average Precision), nDCG ### 텍스트 분류 응용 - **스팸 필터링(Spam Filtering)**: 메일/메시지를 스팸/햄으로 자동 분류 — 나이브 베이즈가 고전적 - **문서 분류(Document Classification)**: 뉴스 카테고리·감성 등 라벨 부여 - **문서 군집(Document Clustering)**: 라벨 없이 유사 문서 묶기 ### 기본 전처리 추가 - **토큰(Token)**: 분석 단위 단어/형태소 - **구문 분석(Parsing)**: 문장의 구문 트리 분석 - **어휘(Vocabulary)**: 코퍼스의 유일 단어 집합 ### 추천 시스템 보강 - **Matrix Factorization(행렬 분해)**: 사용자-아이템 행렬을 잠재 요인 행렬로 분해 — SVD·NMF - **잠재 요인 모형(Latent Factor Model)**: 사용자·아이템을 잠재 차원으로 표현 - **Cold Start 문제**: 신규 사용자·아이템에 데이터가 없어 추천 어려움 - **Hybrid Recommender**: 협업 필터링 + 콘텐츠 기반 결합 ### 영어 NLP 라이브러리 - **NLTK(Natural Language Toolkit)**: 파이썬 NLP의 고전 — 코퍼스·토큰화·POS·구문분석·감성 사전 - **SpaCy**: 빠르고 산업용 NLP — 토큰화·POS·NER·의존구문분석 - **Gensim**: 토픽 모델링·Word2Vec·Doc2Vec 특화 ### 한국어 NLP 도구 - **KoNLPy**: 한국어 NLP의 표준 인터페이스 - **형태소 분석기(KoNLPy 내장)**: - **Mecab**: C++ 구현, 가장 빠름 - **Okt(Twitter)**: 카카오 트위터 분석기 — SNS 적합 - **Komoran**: 정확도 균형 - **Hannanum**: KAIST 개발 - **Kkma**: 서울대 개발 ### Subword 토큰화 - **BPE(Byte Pair Encoding)**: 빈출 문자쌍을 병합하며 어휘 구축 — 미등록 단어(OOV) 해결 - **SentencePiece / WordPiece**: BERT·GPT 계열 모델의 표준 토큰화 ### 토픽 모델링 추가 - **LDA(Latent Dirichlet Allocation)**: 가장 보편적 토픽 모델 — 베이지안 생성 모형 - **BERTopic**: BERT 임베딩 + UMAP + HDBSCAN을 결합한 현대적 토픽 모델 — 의미적으로 일관된 토픽 - **NMF(Non-negative Matrix Factorization)**: DTM을 두 비음수 행렬로 분해 — 토픽 모델링에 활용 ### 추천 시스템 추가 - **콘텐츠 기반 필터링(Content-Based Filtering)**: 아이템의 속성 기반 추천 — 사용자가 좋아한 아이템과 비슷한 아이템 - **협업 필터링(CF)**: 비슷한 사용자/아이템의 행동 패턴 기반 - **Hybrid Recommender**: CF + CBF 결합 ### Stemming 알고리즘 종류 - **Porter Stemmer**: 1980년 제안된 가장 보편적 영어 스테머 — 규칙 기반 - 예: running → run, flies → fli (부정확하지만 일관성 있음) - **Lancaster Stemmer**: 더 공격적, 짧은 어간 생성 — 의미 손실 가능성 ↑ - **Snowball Stemmer / Porter2**: Porter의 개선판, 다국어 지원 - **한국어 스테머**: 형태소 분석(어간 + 어미 분리)이 사실상의 스테밍 역할 ### Lemmatization vs Stemming - **Stemming**: 단순 규칙으로 어간 추출 — 빠름, 결과가 사전 단어 아님 (better → bett) - **Lemmatization**: 사전 기반 표제어 추출 — 정확, 느림, 사전 단어 반환 (better → good) ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **어간 추출** — 어미 제거 — 빠르나 부정확 (running → run) - **표제어 추출** — 사전형으로 변환 — 정확하나 느림 (better → good) - **불용어** — 분석에 도움 안 되는 빈출어 (그, 의, the, is) — 제거 대상 - **N-gram** — 연속된 N개 토큰을 하나의 단위로 처리 (bi-gram, tri-gram) - **Word2Vec** — CBOW(주변→중심), Skip-gram(중심→주변) - **TextRank** — PageRank를 단어 그래프에 적용 - **YAKE** — 통계적 특징 기반 비지도 키워드 추출 - **자카드 유사도** — |A∩B| / |A∪B| — 집합 기반 - **POS Tagging** — 각 토큰의 품사를 부여 (명사·동사·형용사 등) - **TDM** — DTM의 전치 — 행=단어, 열=문서 - **Matrix Factorization** — 사용자-아이템 행렬을 잠재 요인 행렬로 분해 — SVD·NMF - **BPE** — 빈출 문자쌍을 병합하며 어휘 구축 — 미등록 단어(OOV) 해결 - … 보강 신규 문항 더 보기 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 사회연결망 분석 (SNA) URL: https://adsp.todaycode.kr/study/38 태그: 군집분석, 사회연결망 분석, 추천 시스템 ## SNA 정의 **사회연결망 분석(Social Network Analysis, SNA)**은 개인·조직 간의 관계를 그래프 구조로 표현하고 분석하는 기법입니다. ## 네트워크 기본 구성 - **노드(Node/Vertex)**: 개인, 조직 등 분석 단위 - **엣지(Edge/Link)**: 노드 간의 관계 (방향성 유/무) - **밀도(Density)**: 실제 연결 수 / 가능한 최대 연결 수 - **클러스터(Cluster)**: 밀집하게 연결된 노드 집합 ## 중심성(Centrality) 지표 | 지표 | 설명 | 의미 | |------|------|------| | **연결정도 중심성** (Degree) | 직접 연결된 노드 수 | 많은 관계를 맺은 허브 | | **근접 중심성** (Closeness) | 다른 모든 노드까지의 평균 거리 역수 | 정보 전달 속도 | | **매개 중심성** (Betweenness) | 다른 노드 쌍의 최단 경로에 위치하는 빈도 | 정보 흐름의 병목 | | **위세 중심성** (Eigenvector) | 연결된 노드의 중요도까지 반영 | 영향력 있는 노드와의 연결 | ## 응용 분야 - **SNS 영향력 분석**: 핵심 인플루언서 식별 - **조직 관계 분석**: 비공식 리더 발굴 - **추천 시스템**: 협업 필터링의 기반 - **전염병 확산 모델링**: 감염 경로 추적 ### 중심성(Centrality) 종류 - **연결 중심성(Degree Centrality)**: 직접 연결된 노드 수 — 가장 단순 - **근접 중심성(Closeness Centrality)**: 다른 모든 노드까지 거리의 역수 — 정보 확산 속도 - **매개 중심성(Betweenness Centrality)**: 다른 노드 쌍의 최단 경로에 등장하는 빈도 — 정보 흐름 통제력(브로커) - **고유벡터 중심성(Eigenvector Centrality)**: 중요한 노드와 연결될수록 자신도 중요 — 영향력 - **PageRank**: 고유벡터 중심성을 일반화한 알고리즘 — 구글 검색의 기초 ### 네트워크 구조 지표 - **밀도(Density)**: 실제 연결 수 / 가능한 최대 연결 수 — 그래프가 얼마나 빽빽한지 - **응집력(Cohesion)**: 노드 간 연결의 강도와 군집 형성 정도 - **구조적 등위성(Structural Equivalence)**: 동일한 이웃 패턴을 가진 노드들 — 역할 분석에 사용 - **클러스터링 계수(Clustering Coefficient)**: 이웃끼리 서로 연결된 비율 ### 그래프 기본 용어 - **노드(Node, Vertex)**: 그래프의 점 — 사람·문서·도시 등 개체 - **엣지(Edge, Link)**: 노드 사이의 연결선 — 관계·상호작용 - **방향 그래프(Directed Graph)**: 화살표가 있는 그래프 (트위터 팔로우) - **무방향 그래프(Undirected Graph)**: 화살표 없음 (페이스북 친구) - **가중치(Weight)**: 엣지의 강도 (대화 횟수·거리) - **이웃(Neighbor)**: 특정 노드와 직접 연결된 노드들 ### 네트워크 범위 - **전체 네트워크(Whole Network)**: 모든 노드와 관계를 포함 - **자아 네트워크(Ego Network)**: 한 노드(자아, ego)와 그 직접 이웃·이웃 간 관계 ### SNA 추가 구조 지표 - **K-core**: 모든 노드가 최소 k개의 연결을 갖는 부분그래프 - **약한 연결(Weak Tie)**: 자주 만나지 않지만 다른 집단을 연결 — 정보 다양성에 중요 (Granovetter) - **강한 연결(Strong Tie)**: 자주·깊게 상호작용 - **구조적 공백(Structural Hole)**: 두 그룹 사이의 단절 — 이 자리를 메우는 노드(Broker)는 큰 정보·자원 통제력 - **Triadic Closure(삼각 폐쇄)**: A-B와 A-C가 연결되어 있으면 B-C도 연결될 가능성 ↑ — 군집 형성 원리 ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **근접 중심성** — 다른 모든 노드까지 거리의 역수 — 정보 확산 속도 - **매개 중심성** — 다른 노드 쌍의 최단 경로에 등장하는 빈도 — 정보 흐름 통제력(브로커) - **고유벡터 중심성** — 중요한 노드와 연결될수록 자신도 중요 — 영향력 - **PageRank** — 고유벡터 중심성을 일반화한 알고리즘 — 구글 검색의 기초 - **응집력** — 노드 간 연결의 강도와 군집 형성 정도 - **구조적 등위성** — 동일한 이웃 패턴을 가진 노드들 — 역할 분석에 사용 - **방향 그래프** — 화살표가 있는 그래프 (트위터 팔로우) - **자아 네트워크** — 한 노드(자아, ego)와 그 직접 이웃·이웃 간 관계 - **구조적 공백** — 두 그룹 사이의 단절 — 이 자리를 메우는 노드(Broker)는 큰 정보·자원 통제력 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 데이터 마이닝 개요 URL: https://adsp.todaycode.kr/study/48 태그: 데이터베이스, 분석 주제 유형, 분석 방법론, KDD, CRISP-DM, SEMMA, 회귀분석, 로지스틱 회귀, 시계열 분석, 의사결정나무, 인공신경망, 군집분석, 연관분석, 차원 축소, 과적합, 데이터 전처리, 탐색적 분석, 데이터 마이닝, 데이터 마트, 이상치·결측, MLOps·최신 ML ## 데이터 마이닝 정의 **데이터 마이닝(Data Mining)**은 대규모 데이터에서 통계·기계학습 기법을 활용하여 유용한 **패턴과 지식을 자동으로 발견**하는 과정입니다. ## KDD 프로세스 (Knowledge Discovery in Databases) 대용량 데이터베이스에서 지식을 발견하는 5단계 프로세스입니다. | 단계 | 명칭 | 설명 | |------|------|------| | 1 | **데이터 선택 (Selection)** | 분석 목적에 맞는 데이터 추출 | | 2 | **전처리 (Preprocessing)** | 결측치 처리, 이상값 제거, 노이즈 정제 | | 3 | **변환 (Transformation)** | 정규화, 차원 축소, 특징 추출 | | 4 | **데이터 마이닝 (Data Mining)** | 알고리즘 적용, 패턴·규칙 탐색 | | 5 | **해석 및 평가 (Interpretation/Evaluation)** | 발견된 패턴의 의미 해석 및 유용성 평가 | ## CRISP-DM 방법론 (6단계) 산업 표준 데이터 마이닝 방법론입니다. 1. **비즈니스 이해 (Business Understanding)**: 목표 정의 2. **데이터 이해 (Data Understanding)**: 데이터 탐색 3. **데이터 준비 (Data Preparation)**: 전처리·변환 4. **모델링 (Modeling)**: 알고리즘 적용 5. **평가 (Evaluation)**: 비즈니스 목표 부합 여부 검토 6. **배포 (Deployment)**: 실제 환경 적용 ## SEMMA 방법론 (SAS) SAS Institute가 개발한 5단계 방법론입니다. | 단계 | 설명 | |------|------| | **Sample** | 대표 샘플 추출 | | **Explore** | 탐색적 분석, 패턴 파악 | | **Modify** | 변수 변환, 파생변수 생성 | | **Model** | 모델 적합 | | **Assess** | 모델 성능 평가 | ## 데이터 마이닝 주요 기법 | 분류 | 기법 | |------|------| | **분류 (Classification)** | 의사결정나무, 로지스틱 회귀, 신경망, SVM | | **군집 (Clustering)** | K-means, 계층적 군집 | | **연관 (Association)** | 아프리오리(Apriori) 알고리즘 | | **예측 (Prediction)** | 회귀분석, 시계열 분석 | ## 데이터 분리 및 과적합 - **훈련/검증/테스트 비율**: 7:3 또는 6:2:2 - **과적합(Overfitting)**: 훈련 데이터에 과도하게 맞춰 새 데이터에 일반화 실패 - **과소적합(Underfitting)**: 모델이 너무 단순하여 훈련 데이터도 제대로 학습하지 못함 > **시험 핵심**: **KDD 5단계**(선택→전처리→변환→마이닝→해석), **CRISP-DM 6단계**, **SEMMA 5단계**의 순서와 각 방법론 간 비교가 자주 출제됩니다. ### 대표 활용 분야 - **이탈 예측(Churn Prediction)**: 통신·구독 서비스에서 고객 이탈 가능성 예측 → 선제적 retention 마케팅 - **이상거래 탐지(FDS, Fraud Detection System)**: 결제·보험 사기·계좌 이상 패턴 식별 — 불균형 데이터·실시간성 핵심 - **추천 시스템(Recommendation)**: 협업 필터링(사용자/아이템 기반), 콘텐츠 기반, 하이브리드 - **고객 세분화**: RFM(Recency·Frequency·Monetary), 군집분석 활용 - **CLV/LTV(Customer Lifetime Value)**: 고객 생애가치 예측 — 마케팅 ROI 산정 핵심 ### 데이터마이닝 절차 (5단계) 1. **목적 설정(Business Understanding)**: 비즈니스 문제 정의·분석 목표 설정 2. **데이터 준비**: 데이터 수집·정제·통합 3. **데이터 가공(전처리)**: 결측·이상치·변환·특성 생성 4. **데이터 마이닝 기법 적용(Modeling)**: 분류·군집·연관·예측 모델 학습 5. **검증(Evaluation)**: 성능 평가·해석·배포 ### SEMMA 방법론 (SAS) - **Sample**: 표본 추출 - **Explore**: 탐색 - **Modify**: 변환·가공 - **Model**: 모델링 - **Assess**: 평가 ### KDD vs CRISP-DM vs SEMMA - **KDD**: Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation - **CRISP-DM**: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment - **SEMMA**: 위 5단계 - 공통점: 반복적·비즈니스 목적 중심 ### 차원의 저주 (Curse of Dimensionality) - 변수(차원)가 늘어날수록 데이터 간 거리가 비슷해지고 표본 밀도가 급격히 감소 - 해결: 차원축소(PCA·LDA·t-SNE)·특성 선택·정규화 ### 데이터마이닝 모형 분류 - **분류 모형(Classification)**: 범주형 종속변수 예측 (Y/N, 등급) - **예측 모형(Predictive Model)**: 연속형 종속변수 예측 (회귀·시계열) - **기술 모형(Descriptive Model)**: 군집·연관·패턴 발견 — 종속변수 없음 - 동일 알고리즘이 분류와 회귀 양쪽 모두에 쓰일 수 있음 (예: 의사결정나무, 신경망) ### 표준 방법론 풀네임 - **CRISP-DM**: **Cross-Industry Standard Process for Data Mining** - **DMBOK**: Data Management Body of Knowledge ### GIGO 원칙 - **Garbage In, Garbage Out**: 데이터 품질이 모델 품질을 결정 — 전처리·정제가 모델링 못지않게 중요 ### 데이터 마이닝 모형 분류 - **데이터 마이닝 모형(Model)**: 알고리즘이 학습 후 만들어내는 패턴·예측 함수 - **모형 분류**: - **분류(Classification)**: 범주형 종속변수 - **추정(Estimation)**: 연속형 종속변수 — 회귀 - **예측(Prediction)**: 미래값 — 시계열·회귀 - **연관(Association)**: 항목 간 규칙 - **군집(Clustering)**: 라벨 없이 그룹화 - **기술(Description)**: 데이터 특성 요약 ### 측정의 신뢰성·타당성 - **신뢰성(Reliability)**: 측정 결과의 일관성 — 같은 조건에서 같은 결과 - **타당성(Validity)**: 측정하고자 하는 것을 정확히 측정하는지 - **Cronbach's α**: 내적 일관성 신뢰도 지표 (≥ 0.7 권장) ### 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - **이상거래 탐지** — 결제·보험 사기·계좌 이상 패턴 식별 — 불균형 데이터·실시간성 핵심 - **추천 시스템** — 협업 필터링(사용자/아이템 기반), 콘텐츠 기반, 하이브리드 - **고객 세분화** — RFM(Recency·Frequency·Monetary), 군집분석 활용 - **CLV/LTV** — 고객 생애가치 예측 — 마케팅 ROI 산정 핵심 - **예측 모형** — 연속형 종속변수 예측 (회귀·시계열) - **기술 모형** — 군집·연관·패턴 발견 — 종속변수 없음 - **DMBOK** — Data Management Body of Knowledge - **Garbage In, Garbage Out** — 데이터 품질이 모델 품질을 결정 — 전처리·정제가 모델링 못지않게 중요 - **모형 분류** — **분류(Classification)**: 범주형 종속변수 > 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다. ### 다변량 분석 — 판별분석과 요인분석 URL: https://adsp.todaycode.kr/study/49 태그: 분석 방법론, 기술통계, 상관분석, 회귀분석, 시계열 분석, 차원 축소, 판별분석, 요인분석, 데이터 기반 의사결정, 강화학습·지도학습 ## 다변량 분석 정의 **다변량 분석(Multivariate Analysis)**은 2개 이상의 변수를 동시에 분석하는 통계 방법론의 총칭입니다. ## 판별분석 (Discriminant Analysis) **판별분석**은 집단 소속이 알려진 데이터를 이용해 **판별함수**를 도출하고, 새로운 관측치를 해당 집단으로 분류하는 지도학습 기법입니다. ### 핵심 개념 - **목적**: **집단을 구분하는 판별함수 도출** → 새로운 관측치 분류 - **선형 판별분석(LDA)**: **집단 간 분산을 최대화**, 집단 내 분산을 최소화 - **사전 확률(Prior Probability)**: 각 집단에 속할 사전 확률 고려 - **오분류 비용(Misclassification Cost)**: 잘못 분류될 때의 비용 고려 ### 판별분석 vs 회귀분석 | 구분 | 판별분석 | 회귀분석 | |------|---------|----------| | 종속변수 | **범주형** (집단) | 연속형 (수치) | | 목적 | 집단 분류 | 값 예측 | > **시험 포인트**: "집단 간 분산의 비율을 최대화", "판별함수를 이용한 분류" → 판별분석 ## 요인분석 (Factor Analysis) **요인분석**은 다수의 변수들 사이에 존재하는 **공분산 구조**를 분석하여 **잠재 요인(Factor)**을 추출하는 기법입니다. ### 핵심 개념 - **목적**: 여러 변수를 소수의 잠재 요인으로 축약하여 구조 파악 - **탐색적 요인분석(EFA)**: 요인 구조를 사전에 가정하지 않고 탐색 - **확인적 요인분석(CFA)**: 이론에 근거한 요인 구조를 검증 - **공통요인(Common Factor)**: 여러 변수에 공통으로 영향을 주는 잠재 요인 - **고유요인(Unique Factor)**: 특정 변수에만 영향을 주는 요인 - **요인 부하량(Factor Loading)**: 변수와 요인 간 상관관계의 크기 (절댓값 클수록 강한 관계) ### 베리맥스(Varimax) 회전 - **직교 회전(Orthogonal Rotation)** 방법의 대표 - 각 요인의 부하량 분산을 최대화하여 **요인 해석을 단순·명확하게** 만듦 ### 요인분석 vs 주성분분석(PCA) 비교 | 구분 | 요인분석(FA) | 주성분분석(PCA) | |------|------------|----------------| | **목적** | 공분산 구조 설명, 잠재 요인 추출 | **분산 최대화**, 차원 축소 | | **방향** | 공통 요인 → 변수 설명 | 변수 → 주성분 도출 | | **오차항** | 고유요인(오차) 포함 | 없음 | ## 정준상관분석 (Canonical Correlation) - 두 변수 집합(X군, Y군) 간의 **상관관계를 최대화**하는 선형 결합 도출 - 예: 학업 변수군과 취업 변수군 간의 관계 분석 ## 다차원척도법 (MDS, Multidimensional Scaling) - 개체 간 **거리(비유사성)**를 측정하여 **저차원 공간에 시각화** - 유사한 개체는 가깝게, 다른 개체는 멀게 배치 - 예: 소비자 브랜드 인식 지도(Perceptual Map) 작성 > **시험 핵심**: **판별분석** = 집단 분류 목적, 집단 간 분산 최대화 / **요인분석** = 잠재 요인 추출 목적, 공분산 구조 파악 / **PCA** = 분산 최대화, 차원 축소. 이 3가지 차이를 명확히 구분하세요. --- ## 추가 핵심 개념 — 비지도 차원축소 비교 - **t-SNE(t-Distributed Stochastic Neighbor Embedding)**: 고차원 데이터의 국소 이웃 구조를 보존하며 2~3차원에 시각화. 비선형. 군집 구조 시각화에 우수. - **UMAP(Uniform Manifold Approximation and Projection)**: t-SNE보다 빠르고 전역 구조도 일부 보존. 차원 축소·시각화의 최신 기법. - **Kernel PCA**: PCA의 비선형 확장. 커널 트릭으로 고차원 공간에서 선형 PCA 수행. > **시험 핵심**: PCA(선형)·t-SNE(국소 비선형)·UMAP(전역+국소 비선형)·LDA(지도, 클래스 분리)의 비교가 차원축소 단원의 심화 출제 포인트입니다. --- ## 자주 묻는 질문 (FAQ) — 전체 25개 URL: https://adsp.todaycode.kr/faq ### 시험 개요 **Q. ADsP는 어떤 자격증인가요?** A. ADsP(Advanced Data Analytics Semi-Professional, 데이터분석 준전문가)는 한국데이터산업진흥원(Dataq)이 주관하는 국가공인 데이터 분석 자격증입니다. 데이터 이해·분석 기획·데이터 분석 3과목을 다루며, 데이터 분석의 기본 지식을 검증합니다. **Q. ADsP와 ADP는 무엇이 다른가요?** A. ADsP는 준전문가(Semi-Professional) 수준의 이론 중심 시험이고, ADP는 전문가(Professional) 수준으로 이론 + 실기(R 언어) 시험이 모두 있습니다. ADsP는 응시자격 제한이 없으나, ADP는 학위·경력·ADsP 보유 등 응시자격 요건이 있습니다. **Q. ADsP 응시 자격이 있나요?** A. 없습니다. 학력·경력·연령 제한 없이 누구나 응시할 수 있습니다. **Q. ADsP 응시료는 얼마인가요?** A. 2026년 기준 5만 원입니다. 한국데이터산업진흥원(https://www.dataq.or.kr) 공식 접수 페이지에서 확인하세요. ### 시험 일정 **Q. ADsP는 몇 회 시행되나요?** A. 연 4회 시행됩니다. 보통 2월·5월·8월·10월에 실시되며, 시험 6~8주 전에 원서접수가 시작됩니다. **Q. 2026년 ADsP 시험 일정은 어떻게 되나요?** A. 제48회 2026년 2월 7일(토), 제49회 5월 17일(일), 제50회 8월 8일(토), 제51회 10월 31일(토)입니다. 원서접수는 각 시험 약 4주 전 5일간 진행됩니다. ### 출제 범위 **Q. ADsP는 몇 과목인가요?** A. 총 3과목입니다. 1과목 데이터 이해(빅데이터·DBMS·거버넌스), 2과목 데이터 분석 기획(방법론·마스터플랜), 3과목 데이터 분석(통계·머신러닝·R). **Q. ADsP 문항 수와 시험 시간은?** A. 객관식 40문항 + 단답형 10문항, 총 50문항을 90분 동안 풀어야 합니다. **Q. ADsP 합격 기준은?** A. 100점 만점 중 60점 이상이면 합격입니다. 단, 각 과목별로 40% 이상 득점(과락 방지)해야 합니다. **Q. ADsP 1과목 데이터 이해에서는 무엇이 나오나요?** A. DIKW 피라미드, 데이터의 정의와 분류, 데이터베이스(DBMS·OLAP), 빅데이터 3V/5V, 데이터 사이언스, 데이터 거버넌스, 개인정보 비식별화, 하둡·빅데이터 인프라 등이 출제됩니다. **Q. ADsP 2과목 데이터 분석 기획에서는 무엇이 나오나요?** A. 분석 기획 방법론(KDD, CRISP-DM, SEMMA), 분석 마스터플랜, 분석 로드맵, 우선순위 평가(ROI·시급성), 분석 성숙도, 하향식·상향식 접근, 비즈니스 모델 캔버스 등이 출제됩니다. **Q. ADsP 3과목 데이터 분석에서는 무엇이 나오나요?** A. 기술통계, 확률분포, 가설검정(t검정·카이제곱·ANOVA), 회귀분석, 분류분석(의사결정나무·로지스틱회귀·인공신경망), 군집분석, 연관분석, 시계열, 텍스트 마이닝, 앙상블(배깅·부스팅·랜덤포레스트), ROC 곡선, 과적합, 교차검증, R 프로그래밍이 출제됩니다. **Q. ADsP 시험에서 어떤 과목이 가장 어렵나요?** A. 일반적으로 3과목 데이터 분석이 가장 어렵다고 평가됩니다. 통계·머신러닝 개념과 R 코드 해석이 함께 나오기 때문입니다. 비전공자는 이 과목에 학습 시간을 가장 많이 배분하는 편입니다. ### 합격률 **Q. ADsP 합격률은 얼마나 되나요?** A. 최근 회차 기준 응시자의 약 40~55% 정도가 합격합니다. 회차마다 편차가 있지만 필기시험 치고는 상당히 높은 편에 속합니다. **Q. 비전공자도 ADsP 합격할 수 있나요?** A. 가능합니다. 기출문제 반복 + 개념 정리로 4~8주 준비하면 비전공자도 충분히 합격할 수 있습니다. 통계 기초 지식(평균·분산·상관관계)만 확실히 잡으면 3과목도 어렵지 않습니다. ### 공부법 **Q. ADsP 공부 시간은 얼마나 필요한가요?** A. 학습 배경에 따라 다르지만 대체로 40~80시간(2~6주 집중 학습)이 권장됩니다. 데이터 분석 유경험자는 1~2주, 비전공자는 4~6주 정도 목표로 잡으면 무리가 없습니다. **Q. ADsP는 어떻게 공부하면 좋을까요?** A. 권장 순서: (1) 학습노트로 3과목 개념 훑기 → (2) 회차별 기출문제(38~47회) 반복 풀이 → (3) 오답노트 정리 → (4) 시험 3일 전 치트시트로 최종 요약. 기출 반복이 가장 효과적입니다. **Q. ADsP 기출문제는 몇 회차 정도 풀어야 하나요?** A. 최근 5회차(43~47회)는 반드시 풀어야 합니다. 시간이 있다면 38회부터 전체를 풀되, 반복 출제되는 개념(DIKW·CRISP-DM·ROC·과적합 등)에 집중하세요. **Q. ADsP 무료로 공부할 수 있나요?** A. 네. ADsP 학습 사이트(https://adsp.todaycode.kr)에서 학습노트 42개, 기출문제 + 응용 변형문제, 플래시카드, 오답노트, 치트시트를 모두 무료로 제공합니다. 유튜브 무료 강의와 병행하면 책 없이도 준비 가능합니다. **Q. ADsP 책 추천할 만한 것이 있나요?** A. 『ADsP 데이터분석 준전문가』 시리즈(이지패스·시대에듀·데이터에듀) 최신판이 대표적입니다. 다만 최근 시험 경향(응용 변형문제 증가)을 반영한 온라인 자료(https://adsp.todaycode.kr)와 병행하는 것이 효과적입니다. **Q. ADsP는 R을 몰라도 합격할 수 있나요?** A. 가능합니다. R 코드는 3과목에서 나오지만 기본 문법(head, summary, plot, lm, t.test 등 20~30개) 정도만 알면 충분합니다. 코딩 능력보다 코드 결과 해석이 더 자주 출제됩니다. ### 실무 활용 **Q. ADsP 자격증을 따면 어떤 일을 할 수 있나요?** A. 데이터 분석 실무 능력을 인증하는 자격증으로, 데이터 분석가·마케터·기획자·개발자의 이력서 스펙으로 활용됩니다. 데이터 관련 직무 지원 시 기본 소양 증명이 가능하며, 이후 ADP나 빅데이터분석기사로 확장할 수 있습니다. **Q. ADsP 자격증 유효기간은?** A. 영구 자격증입니다. 갱신·재취득 필요 없습니다. **Q. ADsP는 취업에 얼마나 도움되나요?** A. 필수 자격증은 아니지만 데이터 관련 직무 지원 시 '기본 소양' 증명이 됩니다. 특히 신입·비전공자의 경우 데이터 분야 관심과 학습 의지를 어필하는 좋은 근거가 됩니다. 실무 프로젝트 경험과 함께 제시하면 효과가 더 큽니다. **Q. ADsP 다음 단계 자격증은 무엇이 있나요?** A. (1) ADP(데이터분석 전문가) — 이론 + 실기(R), (2) 빅데이터분석기사(국가기술자격) — 통계·머신러닝 필기 + 실기, (3) SQLD(SQL 개발자) — 데이터베이스 실무 자격증. ADsP → SQLD → 빅데이터분석기사 → ADP 순서가 흔합니다.