<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0"
     xmlns:content="http://purl.org/rss/1.0/modules/content/"
     xmlns:atom="http://www.w3.org/2005/Atom"
     xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>ADsP 학습노트 - 데이터분석 준전문가 시험 대비</title>
    <link>https://adsp.todaycode.kr/</link>
    <atom:link href="https://adsp.todaycode.kr/feed.xml" rel="self" type="application/rss+xml" />
    <description>한국데이터산업진흥원(Dataq) 주관 ADsP(데이터분석 준전문가) 자격증 시험 대비 무료 학습 사이트. 3과목 42개 핵심 주제와 38~47회 기출문제·응용 변형문제를 제공합니다.</description>
    <language>ko-KR</language>
    <copyright>© todaycode</copyright>
    <lastBuildDate>Thu, 01 Oct 2026 10:29:04 GMT</lastBuildDate>
    <generator>ADsP 학습 build pipeline</generator>
    <image>
      <url>https://adsp.todaycode.kr/og-image.svg</url>
      <title>ADsP 학습</title>
      <link>https://adsp.todaycode.kr/</link>
    </image>
    <item>
      <title>데이터의 정의와 분류</title>
      <link>https://adsp.todaycode.kr/study/1</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/1</guid>
      <pubDate>Thu, 01 Oct 2026 10:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터 유형</category>
      <category>데이터베이스</category>
      <category>IoT·플랫폼</category>
      <category>SQL</category>
      <description>데이터란 &quot;추론과 추정의 근거를 이루는 사실&quot;이라는 사전적 정의를 가지고 있습니다. 아직 가공되지 않은 원시 상태의 숫자, 문자, 기호 등을 뜻하며, 그 자체로는 의미가 없지만 다른 데이터와의 상호관계 속에서 가치를 가질 수 있습니다. 예를 들어 &quot;25&quot;라는 숫자 자체는 아무 의미가 없지만, &quot;오늘의 기온은 25도&quot;라는 맥락이 붙으면 정보가 됩니다. 데이터는 성격에 따라 크게 정성적 데이터와 정량적 데이터로 나뉩니다. 정성적(Qualitative) 데이터는 수치로 측정하기 어려운 데이터입니다. 주관식 응답, SNS 텍스트, 기상특보 등이 여기에 해당하며, 저장하고 분석하는 데 상대적으로 많은 비용과 시간이 듭니다. 정량적(Quantitative) 데이터는 온도, 습도, 강우량처럼 숫자로 표현되는 정형 데이터입니다. 양이 많아도 저장과 분석이 비교적 용이합니다. 데이터는 저장 형태에 따라서도 세 가지로 구분됩니다. 정형 데이터는 관계형 데이터베이스의 테이블처럼 행과 열로 구조화된 데이…</description>
      <content:encoded><![CDATA[<p>데이터란 "추론과 추정의 근거를 이루는 사실"이라는 사전적 정의를 가지고 있습니다. 아직 가공되지 않은 원시 상태의 숫자, 문자, 기호 등을 뜻하며, 그 자체로는 의미가 없지만 다른 데이터와의 상호관계 속에서 가치를 가질 수 있습니다. 예를 들어 "25"라는 숫자 자체는 아무 의미가 없지만, "오늘의 기온은 25도"라는 맥락이 붙으면 정보가 됩니다. 데이터는 성격에 따라 크게 정성적 데이터와 정량적 데이터로 나뉩니다. 정성적(Qualitative) 데이터는 수치로 측정하기 어려운 데이터입니다. 주관식 응답, SNS 텍스트, 기상특보 등이 여기에 해당하며, 저장하고 분석하는 데 상대적으로 많은 비용과 시간이 듭니다. 정량적(Quantitative) 데이터는 온도, 습도, 강우량처럼 숫자로 표현되는 정형 데이터입니다. 양이 많아도 저장과 분석이 비교적 용이합니다. 데이터는 저장 형태에 따라서도 세 가지로 구분됩니다. 정형 데이터는 관계형 데이터베이스의 테이블처럼 행과 열로 구조화된 데이터입니다. 엑셀 스프레드시트나 SQL 테이블이 대표적입니다. 반정형 데이터는 데이터의 구조에 대한 메타 정보를 함께 포함하고 있는 데이터로, HTML, XML, JSON 등이 해당됩니다. 비정형 데이터는 이미지, 동영상, 음성, 텍스트처럼 정해진 구조가 없는 데이터입니다. 시험에서 "HTML은 정형 데이터이다"라는 보기가 자주 등장하는데, HTML은 반정형 데이터이므로 틀린 설명입니다. 또한 IoT 기기에서 생성되는 로그 데이터도 반정형 데이터에 가깝습니다. 핵심 요약 &amp; 시험 포인트 데이터란 추론과 추정의 근거를 이루는 사실(사전적 정의)로, 상호관계 속에서 가치를 가질 수 있으며 추정 및 예측을 위한 근거 자료입니다. 구분 설명 예시 정성적 데이터 (Qualitative) 수치 측정 어려움. 저장/분석에 많은 비용·시간 소요 주관식 응답, 기상특보, SNS 텍스트 정량적 데이터 (Quantitative) 수치 기반 정형 데이터. 대량이어도 저장/분석 용이 온도, 습도, 강우량, 풍속 시험 포인트: HTML, XML, JSON 등은 반정형 데이터입니다. 이미지·동영상·텍스트 등은 비정형 데이터입니다. 주의: 정성적/정량적 분류와 정형/반정형/비정형 분류는 서로 독립적인 두 가지 분류 기준입니다. 정성적 데이터가 주로 비정형 형태를 띠지만, 정성적=비정형으로 단순 동일시하지 마세요. 데이터 유형 — 정량적 vs 정성적 유형 특징 예시 정량적(Quantitative) 수치로 측정·계산 가능 키, 몸무게, 매출, 횟수 정성적(Qualitative) 언어·기호·범주로 표현 색상, 의견, 텍스트, 등급 정량적 데이터의 하위 분류 - 이산형(Discrete): 셀 수 있는 정수값 (학생 수, 자녀 수) - 연속형(Continuous): 셀 수 없는 실수값 (키, 시간) 정성적 데이터의 하위 분류 - 명목형(Nominal): 순서 없는 범주 (성별, 혈액형) - 순서형(Ordinal): 순서 있는 범주 (만족도 5단계) 주의: 정형/반정형/비정형 분류는 "데이터 구조"의 분류이고, 정량적/정성적 분류는 "데이터 본질"의 분류로 서로 다름. 자료 형태 분류 - 정성적(Qualitative) 자료: 범주·속성·언어 — 명목·서열 척도 (예: 성별·혈액형·등급) - 정량적(Quantitative) 자료: 수치 — 등간·비율 척도 (예: 키·점수·온도) - 이산형(Discrete): 셀 수 있는 값 (자녀 수·불량품 개수) - 연속형(Continuous): 연속된 실수값 (키·무게·시간) - 범주형(Categorical) vs 수치형(Numerical): 데이터 분석에서의 실무 구분 데이터 파일 형식 - 정형 데이터: 행·열 구조의 RDB·스프레드시트 - 반정형 데이터: 스키마는 있으나 RDB는 아님 — XML·JSON·HTML·로그 - 비정형 데이터: 구조 없음 — 이미지·동영상·텍스트·음성 - 표준 파일 형식: - CSV(Comma-Separated Values): 콤마 구분, 가장 보편적인 평문 표 형식 - TSV: 탭 구분 - JSON: 키-값 중…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>DIKW 피라미드</title>
      <link>https://adsp.todaycode.kr/study/2</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/2</guid>
      <pubDate>Thu, 01 Oct 2026 09:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>DIKW 피라미드</category>
      <category>분석 주제 유형</category>
      <description>DIKW 피라미드는 데이터(Data), 정보(Information), 지식(Knowledge), 지혜(Wisdom)의 네 단계로 이루어진 계층 구조입니다. 원시 데이터에서 출발하여 점차 가공과 해석을 거치면서 더 높은 수준의 통찰로 발전하는 과정을 보여줍니다. 이 개념은 ADsP 시험에서 매회 출제되는 최빈출 주제이므로 반드시 이해해야 합니다. 가장 아래에 위치한 데이터(Data)는 가공되기 전의 객관적 사실이자 순수한 수치 또는 기호입니다. &quot;A마트는 100원에, B마트는 300원에 연필을 판매한다&quot;처럼 단순한 사실의 나열이 데이터에 해당합니다. 정보(Information)는 이 데이터를 가공하여 패턴을 인식하고 의미를 도출한 것입니다. &quot;A마트 연필이 B마트보다 싸다&quot;가 정보의 예입니다. 지식(Knowledge)은 상호 연결된 정보 패턴을 이해하여 예측한 결과물입니다. &quot;저렴한 A마트에서 연필을 사야겠다&quot;라는 판단이 지식에 해당합니다. 지혜(Wisdom)는 근본 원리에 대한 깊은…</description>
      <content:encoded><![CDATA[<p>DIKW 피라미드는 데이터(Data), 정보(Information), 지식(Knowledge), 지혜(Wisdom)의 네 단계로 이루어진 계층 구조입니다. 원시 데이터에서 출발하여 점차 가공과 해석을 거치면서 더 높은 수준의 통찰로 발전하는 과정을 보여줍니다. 이 개념은 ADsP 시험에서 매회 출제되는 최빈출 주제이므로 반드시 이해해야 합니다. 가장 아래에 위치한 데이터(Data)는 가공되기 전의 객관적 사실이자 순수한 수치 또는 기호입니다. "A마트는 100원에, B마트는 300원에 연필을 판매한다"처럼 단순한 사실의 나열이 데이터에 해당합니다. 정보(Information)는 이 데이터를 가공하여 패턴을 인식하고 의미를 도출한 것입니다. "A마트 연필이 B마트보다 싸다"가 정보의 예입니다. 지식(Knowledge)은 상호 연결된 정보 패턴을 이해하여 예측한 결과물입니다. "저렴한 A마트에서 연필을 사야겠다"라는 판단이 지식에 해당합니다. 지혜(Wisdom)는 근본 원리에 대한 깊은 이해를 바탕으로 도출되는 창의적 아이디어입니다. "다른 상품들도 A마트가 B마트보다 저렴할 것이다"라는 일반화된 판단이 지혜입니다. 시험에서는 "이번 8월에 지난 1년 매출액의 50%가 집중되어 있다"와 같은 구체적 문장이 DIKW 중 어디에 해당하는지 묻는 문제가 출제됩니다. 핵심은 '지식'은 "해야겠다"처럼 의사결정을 내리는 단계이고, '지혜'는 "할 것이다"처럼 근본 원리를 통해 범위를 확장하여 창의적으로 판단하는 단계라는 점입니다. '정보'는 데이터 간의 비교나 관계를 서술한 것이고, '데이터'는 가공 없는 순수한 사실입니다. 핵심 요약 &amp; 시험 포인트 데이터→정보→지식→지혜로 이어지는 계층 구조입니다. 단계 정의 예시 Data (데이터) 가공 전의 객관적 사실, 순수한 수치/기호 "A마트는 100원, B마트는 300원에 연필 판매" Information (정보) 데이터 가공 후 패턴 인식·의미 도출 "A마트 연필이 B마트보다 싸다" Knowledge (지식) 정보 패턴을 이해하고 예측에 활용 "A마트에서 연필을 사야겠다" Wisdom (지혜) 근본 원리에 대한 깊은 이해 기반 창의적 아이디어 "다른 상품도 A마트가 더 저렴할 것이다" 시험 포인트: DIKW 연결 문제는 4447회 모두 출제된 최빈출 주제입니다. 특히 '지식'은 예측, '지혜'는 근본 원리 이해에 기반한 창의적 판단이라는 점을 구분하세요.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>지식경영 — 암묵지와 형식지</title>
      <link>https://adsp.todaycode.kr/study/3</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/3</guid>
      <pubDate>Thu, 01 Oct 2026 08:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>지식경영</category>
      <category>데이터베이스</category>
      <description>지식경영이란 개인의 암묵지와 집단의 형식지 간에 상호작용(생성, 발전, 전환)을 통해 지식을 발전시키는 기업 경영 방식입니다. 이 개념을 이해하려면 먼저 암묵지와 형식지의 차이를 알아야 합니다. 암묵지(Tacit Knowledge)는 경험과 학습을 통해 개인에게 습득된 무형의 지식으로, 말이나 글로 표현하기 어려워 다른 사람에게 공유하기 힘듭니다. 자동차 운전 기술, 숙련된 요리사의 감각, 강연 스킬 등이 대표적인 예입니다. 형식지(Explicit Knowledge)는 매뉴얼, 설계도, 데이터베이스, 프로그램 코드처럼 문서화되어 있어 전달과 공유가 용이한 지식입니다. 암묵지와 형식지는 네 단계의 전환 과정을 통해 상호작용하며 조직의 지식을 발전시킵니다. 이를 SECI 모델이라고 합니다. 첫 번째 단계인 공통화(Socialization)는 암묵지에서 암묵지로의 전환으로, 선배가 후배에게 실무 노하우를 직접 보여주며 전달하는 것에 해당합니다. 두 번째 표출화(Externalization…</description>
      <content:encoded><![CDATA[<p>지식경영이란 개인의 암묵지와 집단의 형식지 간에 상호작용(생성, 발전, 전환)을 통해 지식을 발전시키는 기업 경영 방식입니다. 이 개념을 이해하려면 먼저 암묵지와 형식지의 차이를 알아야 합니다. 암묵지(Tacit Knowledge)는 경험과 학습을 통해 개인에게 습득된 무형의 지식으로, 말이나 글로 표현하기 어려워 다른 사람에게 공유하기 힘듭니다. 자동차 운전 기술, 숙련된 요리사의 감각, 강연 스킬 등이 대표적인 예입니다. 형식지(Explicit Knowledge)는 매뉴얼, 설계도, 데이터베이스, 프로그램 코드처럼 문서화되어 있어 전달과 공유가 용이한 지식입니다. 암묵지와 형식지는 네 단계의 전환 과정을 통해 상호작용하며 조직의 지식을 발전시킵니다. 이를 SECI 모델이라고 합니다. 첫 번째 단계인 공통화(Socialization)는 암묵지에서 암묵지로의 전환으로, 선배가 후배에게 실무 노하우를 직접 보여주며 전달하는 것에 해당합니다. 두 번째 표출화(Externalization)는 암묵지를 형식지로 전환하는 것으로, 경험적 노하우를 책이나 매뉴얼로 문서화하는 과정입니다. 세 번째 연결화(Combination)는 형식지에서 형식지로의 전환으로, 기존 문서에 새로운 지식을 추가하거나 여러 문서를 결합하는 것입니다. 네 번째 내면화(Internalization)는 형식지를 암묵지로 전환하는 것으로, 매뉴얼을 읽고 실습하여 자신만의 체화된 기술로 만드는 과정입니다. 순서는 반드시 "공통화→표출화→연결화→내면화"로 기억해야 하며, 47회 시험에서 이 순서를 묻는 문제가 출제되었습니다. 핵심 요약 &amp; 시험 포인트 지식경영은 개인의 암묵지와 집단의 형식지 간 상호작용(생성·발전·전환)을 통해 지식을 발전시키는 기업 경영 방식입니다. 구분 특징 예시 암묵지 경험·학습으로 개인에게 습득된 무형의 지식. 공유 어려움 자동차 운전, 강연, 운동 형식지 문서화된 지식. 전달·공유 용이 작업 매뉴얼, 설계도, DB, 프로그램 지식 전환 4단계 (SECI 모델) 시험 포인트: 전환 순서는 공통화→표출화→연결화→내면화 입니다. 47회에 순서 문제가 출제되었습니다. 추가 핵심 개념 — KMS와 지식 경영 도구 - KMS(Knowledge Management System, 지식관리시스템): 조직 구성원의 암묵지(노하우·경험)를 형식지(매뉴얼·문서)로 표출화·저장·공유하는 시스템. SECI 모델의 실무 구현체로 협업 플랫폼(Confluence·Notion), 위키, 커뮤니티 오브 프랙티스가 대표 도구. - CoP(Community of Practice): 동일한 관심·전문성을 가진 구성원들이 자발적으로 지식을 공유·발전시키는 비공식 학습 공동체. SECI의 사회화·내면화 단계의 무대가 됨. 시험 핵심: SECI 4단계(공통화·표출화·연결화·내면화)와 KMS의 역할이 결합되어 출제됩니다. SECI 모델 (Nonaka &amp; Takeuchi) - 지식변환(Knowledge Conversion): 암묵지와 형식지 사이를 4가지 방식으로 변환하며 지식이 창출·확산 - 공통화(Socialization, 암묵 → 암묵): 경험·관찰·도제식 학습으로 암묵지를 공유 - 표출화(Externalization, 암묵 → 형식): 암묵지를 언어·문서·모형으로 표현 — 매뉴얼 작성·메타포 사용 - 연결화(Combination, 형식 → 형식): 흩어진 형식지를 결합·체계화 — DB·문서 통합 - 내면화(Internalization, 형식 → 암묵): 형식지를 실제 경험으로 체득 — 학습·실습 - 4단계가 나선형으로 반복되며 조직 지식이 누적·발전 (Knowledge Spiral) SECI 모델 영문 표기 변형 - 한국 교재마다 표기가 다르므로 영문 원어를 알아두는 것이 중요: - 사회화(Socialization): 암묵 → 암묵 (Socialization, S) - 외부화(Externalization, 표출화): 암묵 → 형식 (E) - 종합화(Combination, 연결화): 형식 → 형식 (C) - 내면화(Internalization): 형식 → 암묵 (I) - …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터베이스의 정의와 특징</title>
      <link>https://adsp.todaycode.kr/study/4</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/4</guid>
      <pubDate>Thu, 01 Oct 2026 07:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터베이스</category>
      <category>분석 주제 유형</category>
      <category>OLAP</category>
      <category>IoT·플랫폼</category>
      <category>데이터 품질</category>
      <category>MLOps·최신 ML</category>
      <description>데이터베이스는 여러 사람이 공유하여 사용할 목적으로 통합하여 관리하는 데이터의 집합을 말합니다. 일상생활에서 도서관의 책 목록, 온라인 쇼핑몰의 상품 목록 등이 모두 데이터베이스라고 할 수 있습니다. 시험에서는 데이터베이스의 네 가지 특징과 다양한 활용 측면이 출제됩니다. 데이터베이스의 네 가지 특징은 다음과 같습니다. 통합 데이터(Integrated Data)는 동일한 내용이 중복되어 저장되지 않도록 관리된 데이터입니다. 예를 들어 같은 고객 정보가 두 곳에 따로 저장되지 않습니다. 공유 데이터(Shared Data)는 여러 사용자가 동시에 접근하여 활용할 수 있는 데이터입니다. 여기서 주의할 점은 &quot;모든 사용자가 동일한 목적으로 활용한다&quot;는 설명은 틀렸다는 것입니다. 같은 데이터라도 마케팅 부서와 재무 부서가 서로 다른 목적으로 활용할 수 있습니다. 운영 데이터(Operational Data)는 조직의 고유한 기능을 수행하기 위해 반드시 필요한 데이터입니다. 저장 데이터(Stor…</description>
      <content:encoded><![CDATA[<p>데이터베이스는 여러 사람이 공유하여 사용할 목적으로 통합하여 관리하는 데이터의 집합을 말합니다. 일상생활에서 도서관의 책 목록, 온라인 쇼핑몰의 상품 목록 등이 모두 데이터베이스라고 할 수 있습니다. 시험에서는 데이터베이스의 네 가지 특징과 다양한 활용 측면이 출제됩니다. 데이터베이스의 네 가지 특징은 다음과 같습니다. 통합 데이터(Integrated Data)는 동일한 내용이 중복되어 저장되지 않도록 관리된 데이터입니다. 예를 들어 같은 고객 정보가 두 곳에 따로 저장되지 않습니다. 공유 데이터(Shared Data)는 여러 사용자가 동시에 접근하여 활용할 수 있는 데이터입니다. 여기서 주의할 점은 "모든 사용자가 동일한 목적으로 활용한다"는 설명은 틀렸다는 것입니다. 같은 데이터라도 마케팅 부서와 재무 부서가 서로 다른 목적으로 활용할 수 있습니다. 운영 데이터(Operational Data)는 조직의 고유한 기능을 수행하기 위해 반드시 필요한 데이터입니다. 저장 데이터(Stored Data)는 컴퓨터가 접근할 수 있는 저장 매체에 저장된 데이터를 의미합니다. 데이터베이스는 활용 측면에서도 여러 관점으로 나뉩니다. 정보 축적 및 전달 측면에서는 기계 가독성(정보처리 기기가 대량 정보를 읽고 쓸 수 있음), 검색 가능성(필요한 정보를 쉽게 찾음), 원격 조작성(온라인에서 원거리 활용 가능)이라는 세 가지 특성을 가집니다. 이 세 가지 특성을 묻는 문제가 46회와 47회에 출제되었습니다. 정보 이용 측면은 사용자가 원하는 정보를 신속하게 획득하는 것이고, 정보 관리 측면은 관리 소프트웨어와 하드웨어에 관한 것이며, 정보 기술 발전 측면은 네트워크 기술 발전을 견인하는 역할에 해당합니다. 핵심 요약 &amp; 시험 포인트 데이터베이스는 여러 사람이 공유하여 사용할 목적으로 통합하여 관리하는 데이터의 집합입니다. 데이터베이스의 4가지 특징 특징 설명 통합 데이터(Integrated Data) 중복 최소화, 통제된 데이터 공유 데이터(Shared Data) 여러 사용자가 서로 다른 목적으로 동시에 사용 운영 데이터(Operational Data) 조직 고유 기능 수행에 반드시 필요한 데이터 저장 데이터(Stored Data) 컴퓨터가 접근 가능한 저장 매체에 보관 정보 축적 및 전달 측면 3대 특성 기계 가독성, 검색 가능성, 원격 조작성 시험 포인트: 공유 데이터는 여러 사용자가 서로 다른 목적으로 활용할 수 있습니다. 동일 목적이 아닙니다. 데이터베이스 활용 분야 - 주요 시스템 4가지 시스템 풀네임 목적 데이터 CRM Customer Relationship Management 고객 관계 관리 고객, 구매, 접점 SCM Supply Chain Management 공급망 최적화 재고, 물류, 협력사 ERP Enterprise Resource Planning 전사 자원 통합 회계, HR, 생산 BI Business Intelligence 의사결정 지원 OLAP, 대시보드, 리포트 분야별 데이터베이스 활용 - 금융: 신용평가, 사기 탐지, 리스크 관리 - 제조: 품질 관리, 예측 정비, 공정 최적화 - 유통: 재고 관리, 추천, 가격 최적화 - 공공: 행정 통계, 정책 결정, 민원 분석 - 의료: 전자의무기록(EMR), 임상의사결정지원(CDSS), 신약 개발 시험 포인트: CRM은 "고객", SCM은 "공급망", ERP는 "전사 자원". BI는 분석·의사결정. 분야별 활용 사례 매칭 문제 자주 출제. 데이터 무결성(Integrity) 종류 - 개체 무결성(Entity Integrity): 기본키는 NULL이 될 수 없고 유일해야 함 — 모든 행을 고유하게 식별 - 참조 무결성(Referential Integrity): 외래키 값은 참조 테이블의 기본키에 실제로 존재하거나 NULL이어야 함 — 부모-자식 관계 일관성 보장 - 도메인 무결성: 컬럼 값이 정의된 도메인(타입·범위·형식)을 따라야 함 - 사용자 정의 무결성: 업무 규칙에 따른 제약 조건(예: 나이 ≥ 0) 인덱스(Index)와 자료구조 - 인덱스(Index): 테이블 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>DBMS와 데이터베이스 유형</title>
      <link>https://adsp.todaycode.kr/study/5</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/5</guid>
      <pubDate>Thu, 01 Oct 2026 06:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터 유형</category>
      <category>데이터베이스</category>
      <category>DBMS</category>
      <category>데이터 전처리</category>
      <category>OLAP</category>
      <category>SQL</category>
      <category>MLOps·최신 ML</category>
      <description>DBMS(Database Management System)는 사용자의 요구에 따라 정보를 처리하고 데이터베이스를 관리해주는 소프트웨어입니다. 쉽게 말해, 데이터베이스라는 거대한 창고를 체계적으로 관리해주는 관리자 프로그램이라고 생각하면 됩니다. DBMS의 장점으로는 데이터의 중복을 최소화하고, 일관성과 무결성을 유지하며, 여러 사용자가 동시에 접근할 수 있고, SQL이라는 표준화된 언어로 제어가 쉽고, 접근 권한을 제어하여 민감한 정보를 보호할 수 있다는 점이 있습니다. 여기서 무결성(Integrity)이란 데이터의 정확성과 일관성이 유지되는 것을 말합니다. 단점으로는 모든 데이터 문제를 해결할 수 없고, 유지보수 비용이 발생하며, 전문적인 관리 지식이 필요하고, 시스템에 문제가 생기면 저장된 모든 데이터에 영향을 줄 수 있으며, 새로운 버전을 적용할 때 호환성 문제가 발생할 수 있다는 점이 있습니다. DBMS는 크게 세 가지 유형으로 나뉩니다. RDBMS(관계형 데이터베이스 관리 …</description>
      <content:encoded><![CDATA[<p>DBMS(Database Management System)는 사용자의 요구에 따라 정보를 처리하고 데이터베이스를 관리해주는 소프트웨어입니다. 쉽게 말해, 데이터베이스라는 거대한 창고를 체계적으로 관리해주는 관리자 프로그램이라고 생각하면 됩니다. DBMS의 장점으로는 데이터의 중복을 최소화하고, 일관성과 무결성을 유지하며, 여러 사용자가 동시에 접근할 수 있고, SQL이라는 표준화된 언어로 제어가 쉽고, 접근 권한을 제어하여 민감한 정보를 보호할 수 있다는 점이 있습니다. 여기서 무결성(Integrity)이란 데이터의 정확성과 일관성이 유지되는 것을 말합니다. 단점으로는 모든 데이터 문제를 해결할 수 없고, 유지보수 비용이 발생하며, 전문적인 관리 지식이 필요하고, 시스템에 문제가 생기면 저장된 모든 데이터에 영향을 줄 수 있으며, 새로운 버전을 적용할 때 호환성 문제가 발생할 수 있다는 점이 있습니다. DBMS는 크게 세 가지 유형으로 나뉩니다. RDBMS(관계형 데이터베이스 관리 시스템)는 데이터를 행과 열로 구성된 테이블 형태로 관리하며, MySQL, Oracle, PostgreSQL, MS SQL Server 등이 대표적입니다. 가장 널리 사용되는 유형입니다. RDBMS는 ACID 특성을 보장합니다: 원자성(Atomicity) 트랜잭션은 전부 성공하거나 전부 취소, 일관성(Consistency) 데이터 정합성 유지, 고립성(Isolation) 다른 트랜잭션의 영향 차단, 지속성(Durability) 완료된 트랜잭션은 영구 보존. ODBMS(객체 지향 데이터베이스 관리 시스템)는 복잡한 데이터 구조를 객체 단위로 표현하고 관리하며, 상위 계층의 속성과 방법을 하위 계층이 물려받는 상속 개념을 지원합니다. NoSQL(Non-SQL)은 관계형 DB보다 덜 제한적인 일관성 모델을 사용하며, 디자인이 단순하고 수평적 확장이 쉬운 것이 특징입니다. MongoDB, Redis, Apache Cassandra, HBase 등이 대표적입니다. 대용량 비정형 데이터를 다룰 때 주로 사용됩니다. NoSQL은 RDBMS의 ACID 대신 BASE 특성을 가집니다: 기본 가용성(Basically Available) 항상 응답은 보장, 소프트 상태(Soft State) 시간에 따라 데이터 상태가 변할 수 있음, 최종 일관성(Eventually Consistent) 일시적 불일치 허용 후 최종적으로 일관성 달성. RDBMS vs NoSQL 일관성 모델 비교 속성 RDBMS (ACID) NoSQL (BASE) 가용성 엄격한 일관성 우선 높은 가용성 우선 일관성 즉시 일관성 보장 최종적 일관성(Eventually Consistent) 확장성 수직 확장(Scale-Up) 수평 확장(Scale-Out) 시험 포인트: RDBMS = ACID, NoSQL = BASE 특성을 가집니다. OLAP 5대 연산 OLAP(Online Analytical Processing)은 다차원 데이터를 분석하기 위한 연산입니다. 연산 설명 예시 Drill-down 상위 차원 → 하위 차원 (상세화) 연도 → 월 → 일 Roll-up 하위 차원 → 상위 차원 (요약·집계) 일 → 월 → 연도 Slice 하나의 차원을 한 값으로 고정 2025년 매출만 보기 Dice 여러 차원을 부분집합으로 자름 2025년 + 서울 + 모바일 Pivot(Rotate) 차원의 축을 회전 행/열 교환 OLAP vs OLTP 구분 OLAP OLTP 목적 분석·의사결정 운영·트랜잭션 데이터 집계, 이력 현재, 실시간 쿼리 복잡, 읽기 중심 단순, 읽기/쓰기 사용자 분석가, 경영진 일반 사용자 시험 포인트: Drill-down ↔ Roll-up이 짝. Slice는 1차원, Dice는 다차원 부분집합. Pivot은 축 회전. 관계형 DB 정규화 - 1NF(제1정규형): 모든 속성이 원자값(분해 불가) - 2NF(제2정규형): 1NF + 부분 함수 종속 제거 (기본키 일부에만 종속되는 속성 분리) - 3NF(제3정규형): 2NF + 이행적 함수 종속 제거 (A→B→C에서 C가 A에 직접 종속되게 분리…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>기억 용량 단위와 자료 구성 단위</title>
      <link>https://adsp.todaycode.kr/study/6</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/6</guid>
      <pubDate>Thu, 01 Oct 2026 05:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터베이스</category>
      <category>기억 용량 단위</category>
      <description>컴퓨터가 데이터를 저장할 때 사용하는 용량 단위는 계층적 구조를 가집니다. 가장 작은 단위부터 순서대로 KB(킬로바이트), MB(메가바이트), GB(기가바이트), TB(테라바이트), PB(페타바이트), EB(엑사바이트), ZB(제타바이트), YB(요타바이트)입니다. 각 단계 사이는 정확히 1024배(2의 10승) 관계입니다. 예를 들어 1ZB는 1024EB이고, 1PB는 1024TB입니다. 시험에서는 &quot;1제타바이트는 1024 엑사바이트이다&quot;와 같은 문제가 출제됩니다. 단위 간의 순서를 정확히 외우는 것이 중요하며, &quot;킬(K) 메(M) 기(G) 테(T) 페(P) 엑(E) 제(Z) 요(Y)&quot;로 첫 글자를 연결하여 암기하면 편리합니다. 수학적으로는 KB=2의 10승, MB=2의 20승 등으로 10씩 증가하는 지수로도 표현됩니다. 자료 구성 단위도 계층적 구조를 가집니다. 가장 작은 단위인 비트(Bit)는 0 또는 1의 이진수 하나를 저장하는 데이터의 최소 단위입니다. 4개의 비트가 모이면…</description>
      <content:encoded><![CDATA[<p>컴퓨터가 데이터를 저장할 때 사용하는 용량 단위는 계층적 구조를 가집니다. 가장 작은 단위부터 순서대로 KB(킬로바이트), MB(메가바이트), GB(기가바이트), TB(테라바이트), PB(페타바이트), EB(엑사바이트), ZB(제타바이트), YB(요타바이트)입니다. 각 단계 사이는 정확히 1024배(2의 10승) 관계입니다. 예를 들어 1ZB는 1024EB이고, 1PB는 1024TB입니다. 시험에서는 "1제타바이트는 1024 엑사바이트이다"와 같은 문제가 출제됩니다. 단위 간의 순서를 정확히 외우는 것이 중요하며, "킬(K) 메(M) 기(G) 테(T) 페(P) 엑(E) 제(Z) 요(Y)"로 첫 글자를 연결하여 암기하면 편리합니다. 수학적으로는 KB=2의 10승, MB=2의 20승 등으로 10씩 증가하는 지수로도 표현됩니다. 자료 구성 단위도 계층적 구조를 가집니다. 가장 작은 단위인 비트(Bit)는 0 또는 1의 이진수 하나를 저장하는 데이터의 최소 단위입니다. 4개의 비트가 모이면 니블(Nibble), 8개의 비트가 모이면 1바이트(Byte)가 됩니다. 1바이트는 영문자 한 글자, 숫자 하나, 공백, 또는 특수문자 하나를 표현할 수 있습니다. 한글이나 한자 같은 문자의 바이트 수는 인코딩 방식에 따라 다릅니다. EUC-KR 인코딩에서 한글 1자는 2바이트, UTF-8 인코딩에서 한글 1자는 3바이트를 차지합니다. 바이트 위로는 워드(Word), 컴퓨터가 한 번에 처리하는 명령 단위 필드(Field), 레코드(Record), 파일(File), 데이터베이스(DB) 순서로 점점 큰 단위가 됩니다. 기억 용량 단위 (1024배수) - 비트(Bit) < 바이트(Byte, 8비트) < KB(킬로바이트) < MB(메가) < GB(기가) < TB(테라) < PB(페타) < EB(엑사) < ZB(제타) < YB(요타) - 빅데이터는 보통 TBPB 수준에서 다뤄짐 - 전 세계 데이터 양은 ZB 단위로 측정 (IDC 통계 기준) 자료 구성 단위 (작은 단위부터) - 비트(Bit): 0 또는 1, 정보의 최소 단위 - 니블(Nibble): 4비트 — 16진수 한 자릿수 - 바이트(Byte): 8비트 — 문자 1자 - 워드(Word): CPU가 한 번에 처리하는 비트 수 (16/32/64bit) - 필드(Field): 의미 있는 자료 항목 — 컬럼 1개 - 레코드(Record): 관련 필드의 집합 — 행 1개 - 테이블(Table): 같은 형식 레코드의 집합 - 파일(File): 관련 테이블·데이터의 집합 - 데이터베이스(Database): 통합 관리되는 파일들의 집합 이진(IEC) vs 십진(SI) 단위 구분 - 이진 단위(Binary Unit, IEC 표준): 1024배수 — KiB(키비바이트, 2¹⁰)·MiB·GiB·TiB·PiB - 1 KiB = 1024 B - 1 MiB = 1024 KiB = 1,048,576 B - 메모리·OS 표시에서 사용 - 십진 단위(SI 단위): 1000배수 — KB·MB·GB·TB·PB - 1 KB = 1000 B - 디스크 제조사 광고·네트워크 속도에 사용 - 디스크 크기 vs OS 표시 차이의 원인 — 같은 1TB 디스크가 OS에서 931 GiB로 보임 - ADsP 시험에서는 KB·MB·GB로 보통 출제 (정확한 이진/십진 구분은 부차적) 데이터 구성 단위 추가 - 데이터 가치 사슬(Data Value Chain): 데이터에서 가치로의 흐름 - 생성 → 수집 → 저장 → 처리 → 분석 → 시각화 → 의사결정 → 가치 실현 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 이진 단위 — 1024배수 — KiB(키비바이트, 2¹⁰)·MiB·GiB·TiB·PiB - 십진 단위 — 1000배수 — KB·MB·GB·TB·PB 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>시대별·분야별 데이터베이스 솔루션</title>
      <link>https://adsp.todaycode.kr/study/7</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/7</guid>
      <pubDate>Thu, 01 Oct 2026 04:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터베이스</category>
      <category>분석 주제 유형</category>
      <category>OLAP</category>
      <category>데이터 웨어하우스</category>
      <category>IoT·플랫폼</category>
      <description>기업에서 데이터를 활용하는 방식은 시대에 따라 발전해왔습니다. 이 흐름을 이해하면 각 솔루션의 역할을 쉽게 구분할 수 있습니다. 1980년대에 등장한 OLTP(Online Transaction Processing)는 은행 거래, 온라인 쇼핑, 예약 시스템처럼 실시간으로 발생하는 트랜잭션을 처리하는 시스템입니다. 트랜잭션이란 데이터의 삽입, 수정, 삭제 같은 짧고 빈번한 작업을 의미합니다. 같은 시기에 등장한 OLAP(Online Analytical Processing)는 이미 축적된 대량의 데이터를 다차원적으로 분석하여 통계 요약 정보를 제공하는 시스템입니다. OLTP는 &quot;기록하는 시스템&quot;, OLAP는 &quot;분석하는 시스템&quot;이라고 이해하면 됩니다. 시험에서 이 둘의 구분은 매회 출제되며, &quot;OLTP가 데이터 조회 및 분석에 사용된다&quot;는 설명은 OLAP의 역할을 설명한 것이므로 틀립니다. 2000년대에는 CRM(Customer Relationship Management)과 SCM(Supp…</description>
      <content:encoded><![CDATA[<p>기업에서 데이터를 활용하는 방식은 시대에 따라 발전해왔습니다. 이 흐름을 이해하면 각 솔루션의 역할을 쉽게 구분할 수 있습니다. 1980년대에 등장한 OLTP(Online Transaction Processing)는 은행 거래, 온라인 쇼핑, 예약 시스템처럼 실시간으로 발생하는 트랜잭션을 처리하는 시스템입니다. 트랜잭션이란 데이터의 삽입, 수정, 삭제 같은 짧고 빈번한 작업을 의미합니다. 같은 시기에 등장한 OLAP(Online Analytical Processing)는 이미 축적된 대량의 데이터를 다차원적으로 분석하여 통계 요약 정보를 제공하는 시스템입니다. OLTP는 "기록하는 시스템", OLAP는 "분석하는 시스템"이라고 이해하면 됩니다. 시험에서 이 둘의 구분은 매회 출제되며, "OLTP가 데이터 조회 및 분석에 사용된다"는 설명은 OLAP의 역할을 설명한 것이므로 틀립니다. 2000년대에는 CRM(Customer Relationship Management)과 SCM(Supply Chain Management)이 등장했습니다. CRM은 고객 데이터를 분석하여 고객을 깊이 이해하고, 이를 바탕으로 마케팅 전략을 수립하여 높은 이익을 창출하는 시스템입니다. SCM은 원재료 조달부터 제품이 소비자에게 전달되기까지의 전체 유통 과정을 정보기술로 관리하여 재고와 비용을 최적화하는 시스템입니다. 1990년대에 본격 보급된 ERP(Enterprise Resource Planning)는 회계, 인사, 생산, 물류 등 기업의 핵심 업무를 하나의 통합 시스템으로 관리하며, BI(Business Intelligence)는 데이터 웨어하우스에 축적된 데이터를 분석하여 경영 의사결정에 필요한 정보를 제공합니다. 핵심 요약 &amp; 시험 포인트 시대별 시대 솔루션 핵심 1980년대 OLTP 실시간 트랜잭션 처리 (삽입/수정/삭제) 1980년대 OLAP 다차원 데이터의 대화식 분석 및 통계 요약 1990년대 ERP 회계·인사·생산·물류 등 기업의 핵심 업무 통합 관리 1990년대 DW (데이터 웨어하우스) 의사결정 지원을 위해 주제 중심으로 통합·축적된 데이터 저장소 2000년대 CRM 고객 이해 기반 마케팅 전략 → 이익 창출 2000년대 SCM 정보기술 활용 유통·재고 최적화 시험 포인트: OLTP vs OLAP 구분은 매 회차 출제됩니다. OLTP는 거래 처리(짧고 빈번한 트랜잭션), OLAP는 분석 처리(다차원 데이터 분석)입니다. 분야별 솔루션 핵심 ERP 여러 모듈로 구성된 통합 애플리케이션 → 프로세스 관리 RTE 비즈니스 프로세스 투명·민첩 유지, 지연시간 제거 BI 데이터 웨어하우스에서 경영 의사결정에 필요한 정보 획득</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>빅데이터의 정의와 특성</title>
      <link>https://adsp.todaycode.kr/study/8</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/8</guid>
      <pubDate>Thu, 01 Oct 2026 03:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터베이스</category>
      <category>기억 용량 단위</category>
      <category>빅데이터</category>
      <category>빅데이터 3V/5V</category>
      <category>분석 주제 유형</category>
      <category>우선순위 평가</category>
      <category>모형 평가</category>
      <category>데이터 전처리</category>
      <category>데이터 기반 의사결정</category>
      <category>표본조사</category>
      <description>빅데이터란 기존의 데이터베이스 관리 도구로는 처리하기 어려운 대용량 데이터를 활용하여 새로운 통찰과 가치를 만들어내는 것을 말합니다. 단순히 데이터의 양이 많다는 것을 넘어서, 다양한 형태의 데이터를 빠르게 처리하여 비즈니스에 활용한다는 의미를 포함합니다. 빅데이터의 특성은 흔히 &quot;V&quot;로 시작하는 키워드로 표현됩니다. 3V는 Volume(양), Variety(다양성), Velocity(속도)를 의미합니다. Volume은 테라바이트를 넘어서는 초대규모의 데이터 양을, Variety는 텍스트, 이미지, 영상, 음성 등 정형·반정형·비정형을 아우르는 데이터의 다양성을, Velocity는 데이터가 실시간으로 생성되고 빠르게 처리되어야 하는 속도를 의미합니다. 여기에 Value(가치)를 더한 4V도 자주 언급되며, Value는 투자 대비 수익률(ROI) 관점에서 비즈니스 효과를 강조합니다. 시험에서 &quot;Availability(가용성)&quot;가 빅데이터의 V에 해당한다는 보기가 나오면 틀린 것입니다.…</description>
      <content:encoded><![CDATA[<p>빅데이터란 기존의 데이터베이스 관리 도구로는 처리하기 어려운 대용량 데이터를 활용하여 새로운 통찰과 가치를 만들어내는 것을 말합니다. 단순히 데이터의 양이 많다는 것을 넘어서, 다양한 형태의 데이터를 빠르게 처리하여 비즈니스에 활용한다는 의미를 포함합니다. 빅데이터의 특성은 흔히 "V"로 시작하는 키워드로 표현됩니다. 3V는 Volume(양), Variety(다양성), Velocity(속도)를 의미합니다. Volume은 테라바이트를 넘어서는 초대규모의 데이터 양을, Variety는 텍스트, 이미지, 영상, 음성 등 정형·반정형·비정형을 아우르는 데이터의 다양성을, Velocity는 데이터가 실시간으로 생성되고 빠르게 처리되어야 하는 속도를 의미합니다. 여기에 Value(가치)를 더한 4V도 자주 언급되며, Value는 투자 대비 수익률(ROI) 관점에서 비즈니스 효과를 강조합니다. 시험에서 "Availability(가용성)"가 빅데이터의 V에 해당한다는 보기가 나오면 틀린 것입니다. 빅데이터 시대는 데이터 분석의 방향도 크게 바꾸었습니다. 기존에는 데이터를 미리 정제하고 분석하는 사전처리 방식이었지만 이제는 사후처리 방식으로 전환되고 있습니다. 일부만 뽑아서 분석하는 표본조사에서 모든 데이터를 분석하는 전수조사로 변화하고 있습니다. 또한 소수의 정확한 데이터(질)보다 대량의 데이터(양)를 중시하며, 왜 그런지를 밝히는 인과관계보다 무엇과 관련이 있는지를 파악하는 상관관계를 더 중요시합니다. 이 네 가지 변화 방향은 시험에 빈출되므로 반드시 외워야 합니다. 핵심 요약 &amp; 시험 포인트 빅데이터의 특성은 3V(Volume, Variety, Velocity)에서 4V(+Value), 5V(+Veracity)로 확장됩니다. 특성 의미 Volume(양) 테라바이트를 넘는 초대규모 데이터 Velocity(속도) 실시간 생성 및 처리 Variety(다양성) 정형·반정형·비정형 아우르는 다양한 형태 Value(가치) 투자 대비 비즈니스 효과(ROI) Veracity(정확성) 데이터의 신뢰성·정확도 빅데이터 시대의 4가지 패러다임 변화 기존 방식 빅데이터 방식 사전처리 사후처리 표본조사 전수조사 질(소수 정확) 양(대량 데이터) 인과관계 상관관계 시험 포인트: 빅데이터의 V는 Volume, Velocity, Variety, Value, Veracity입니다. Availability(가용성)는 포함되지 않습니다. 빅데이터 V 모델의 변천 모델 V 항목 출처 3V Volume(규모), Velocity(속도), Variety(다양성) Gartner 2001 (Doug Laney) 4V + Veracity (정확성·신뢰성) IBM 5V + Value (가치) 일반적 정의 7V + Variability(가변성) + Visualization(시각화) 확장 모델 각 V 의미 - Volume: TB → PB → ZB 규모 - Velocity: 실시간/스트리밍 처리 속도 - Variety: 정형(RDB) + 반정형(JSON, XML) + 비정형(텍스트, 이미지, 영상) - Veracity: 데이터의 신뢰성·품질 (노이즈, 결측, 편향) - Value: 분석을 통한 비즈니스 가치 창출 - Variability: 데이터 의미의 시간적·맥락적 가변성 - Visualization: 분석 결과의 시각적 전달 시험 포인트: 3V(Gartner)가 시작. Veracity(정확성), Value(가치)가 핵심 추가 V. 빅데이터의 4V → 5V → 7V - 4V: Volume(규모) · Velocity(속도) · Variety(다양성) · Veracity(정확성) — IBM이 추가 - 5V: 4V + Value(가치) — 데이터 자체보다 추출되는 가치 강조 - 7V: 5V + Validity(유효성) + Volatility(휘발성) 데이터 폭증 배경 - 데이터 폭증(Data Explosion): 소셜미디어·IoT·로그 등으로 생성 데이터가 기하급수적 증가 - 2.5 quintillion bytes/day 수준의 글로벌 데이터 생성 (2018 기준) 빅데이터 정의자…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>빅데이터의 출현 배경과 가치</title>
      <link>https://adsp.todaycode.kr/study/9</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/9</guid>
      <pubDate>Thu, 01 Oct 2026 02:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>데이터 유형</category>
      <category>빅데이터</category>
      <category>빅데이터 가치</category>
      <category>분석 주제 유형</category>
      <category>기술통계</category>
      <category>IoT·플랫폼</category>
      <category>하둡·빅데이터 인프라</category>
      <description>빅데이터가 등장한 배경에는 여러 요인이 있습니다. 소셜미디어(SNS)와 영상 콘텐츠의 폭발적 성장으로 비정형 데이터가 크게 늘어났고, 하드디스크 등 저장 장치의 가격이 크게 하락했습니다. 클라우드 컴퓨팅이 등장하여 분산 병렬 처리로 대규모 데이터를 저비용으로 처리할 수 있게 되었습니다. 인터넷의 보급과 디지털화가 가속되었고, IoT(사물인터넷) 기기의 확산으로 센서 데이터가 대량 생성되기 시작했습니다. 또한 양질전환 법칙이라 하여, 데이터의 양적 누적이 일정 수준을 넘으면 질적으로 완전히 다른 가치를 만들어내는 현상이 나타났습니다. 빅데이터의 가치는 비유적 표현으로도 자주 설명됩니다. 철과 석탄은 1차에서 2차 산업혁명으로의 전환을 이끈 핵심 재료였듯이, 빅데이터가 디지털 혁명의 원료라는 의미입니다. 원유(디지털 경제의 에너지원)는 현대 경제의 주요 에너지원이라는 비유로, 빅데이터가 디지털 경제를 움직이는 에너지라는 뜻입니다. 렌즈는 현미경 렌즈가 보이지 않는 세계를 보여주었듯이, …</description>
      <content:encoded><![CDATA[<p>빅데이터가 등장한 배경에는 여러 요인이 있습니다. 소셜미디어(SNS)와 영상 콘텐츠의 폭발적 성장으로 비정형 데이터가 크게 늘어났고, 하드디스크 등 저장 장치의 가격이 크게 하락했습니다. 클라우드 컴퓨팅이 등장하여 분산 병렬 처리로 대규모 데이터를 저비용으로 처리할 수 있게 되었습니다. 인터넷의 보급과 디지털화가 가속되었고, IoT(사물인터넷) 기기의 확산으로 센서 데이터가 대량 생성되기 시작했습니다. 또한 양질전환 법칙이라 하여, 데이터의 양적 누적이 일정 수준을 넘으면 질적으로 완전히 다른 가치를 만들어내는 현상이 나타났습니다. 빅데이터의 가치는 비유적 표현으로도 자주 설명됩니다. 철과 석탄은 1차에서 2차 산업혁명으로의 전환을 이끈 핵심 재료였듯이, 빅데이터가 디지털 혁명의 원료라는 의미입니다. 원유(디지털 경제의 에너지원)는 현대 경제의 주요 에너지원이라는 비유로, 빅데이터가 디지털 경제를 움직이는 에너지라는 뜻입니다. 렌즈는 현미경 렌즈가 보이지 않는 세계를 보여주었듯이, 빅데이터가 숨겨진 패턴을 발견하게 해준다는 비유입니다. 플랫폼은 다양한 주체가 공동으로 활용할 수 있는 구조물이라는 의미입니다. 빅데이터의 가치를 정확히 산정하기 어려운 이유도 있습니다. 데이터의 활용 방식이 다양해지면서 특정 데이터가 누구에 의해, 언제, 어디서 사용될지 예측하기 어렵습니다. 또한 현재는 쓸모없어 보이는 데이터라도 새로운 분석 기술이 등장하면 가치 있는 데이터로 탈바꿈할 수 있기 때문입니다. 핵심 요약 &amp; 시험 포인트 출현 배경 - SNS·영상 등 비정형 데이터 확산, 저장·처리 장치 가격 하락 - 클라우드 컴퓨팅 (분산 병렬 처리로 비용 감소) - 인터넷 보급, 디지털화, IoT 확산 - 인간 게놈 프로젝트 / 양질전환 법칙 (양적 누적이 질적 비약으로 전환) 빅데이터에 거는 기대 (비유적 표현) 비유 의미 철/석탄 산업혁명의 핵심 재료 원유 주요 에너지원 렌즈 현미경 렌즈처럼 보이지 않는 것을 보게 함 플랫폼 공동 활용 목적의 유·무형 구조물 가치 산정이 어려운 이유 - 데이터 활용 시점/장소/대상이 불분명 (다양한 활용 방식) - 과거에 무가치했던 데이터가 새로운 분석 기술로 가치 창출 가능 데이터 가치 측정의 어려움 4가지 빅데이터 시대에 데이터의 경제적 가치를 평가하기 어려운 이유: 어려움 설명 데이터 활용 방식의 다양성 동일 데이터가 재사용·재조합·Mash-up으로 새 가치 창출 새로운 가치 창출 현재의 가치 ≠ 미래의 가치. 분석 기법 발전으로 잠재 가치 변동 분석 기술의 발전 오늘 분석할 수 없는 데이터가 내일은 가능 (예: 비정형 텍스트, 영상) 데이터 수집·저장 비용 감소 기술 발전으로 비용↓, 가치 평가 기준이 시대마다 변동 시험 포인트: "데이터의 가치 측정이 쉽다"는 보기는 틀림. 재사용·재조합·새로운 활용 등으로 가치가 변동되어 측정이 어려움. 추가 핵심 개념 — 빅데이터 인프라와 처리 아키텍처 - MapReduce: 대용량 데이터를 Map(키-값 변환) → Shuffle(키별 그룹화) → Reduce(집계)의 분산 처리 모델. Google 논문·Hadoop의 핵심. - HDFS(Hadoop Distributed File System): 대용량 파일을 블록 단위로 여러 노드에 분산·복제 저장하는 파일 시스템. NameNode(메타) + DataNode(데이터) 구조. - Hive: HDFS 위에 SQL과 유사한 HiveQL로 질의할 수 있는 데이터 웨어하우스 인프라(내부적으로 MapReduce/Spark 변환). - NoSQL: ACID 대신 BASE(Basically Available·Soft state·Eventually consistent) 특성. 4유형: Key-Value(Redis), Document(MongoDB), Column-family(Cassandra), Graph(Neo4j). - CAP 정리: 분산 시스템은 일관성(Consistency)·가용성(Availability)·분할내성(Partition tolerance) 중 2개만 동시 보장 가능. - 람다(Lambda) 아키텍처…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>빅데이터 활용 방법과 분석 기법</title>
      <link>https://adsp.todaycode.kr/study/10</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/10</guid>
      <pubDate>Thu, 01 Oct 2026 01:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>DBMS</category>
      <category>빅데이터</category>
      <category>빅데이터 활용</category>
      <category>분석 주제 유형</category>
      <category>기술통계</category>
      <category>회귀분석</category>
      <category>인공신경망</category>
      <category>군집분석</category>
      <category>연관분석</category>
      <category>차원 축소</category>
      <category>R 프로그래밍</category>
      <category>데이터 마트</category>
      <category>거리 측정</category>
      <category>IoT·플랫폼</category>
      <category>추천 시스템</category>
      <category>유전 알고리즘</category>
      <category>하둡·빅데이터 인프라</category>
      <description>빅데이터를 활용하는 대표적인 분석 기법들이 있으며, 시험에서는 각 기법의 정의와 적용 사례를 정확히 구분할 수 있는지를 묻습니다. 연관규칙학습(Association Rule Learning)은 데이터 변수 간의 의미 있는 연관관계를 발견하는 분석입니다. &quot;기저귀를 사는 고객이 맥주도 함께 산다&quot;는 유명한 장바구니 분석이 대표적 사례입니다. &quot;커피를 구매한 사람이 탄산음료도 구매할지 예측&quot;하는 것도 연관분석에 해당합니다. 유형분석(Clustering)은 사용자의 특성에 맞게 그룹이나 범주로 나누어 분류하는 것으로, 고객 세분화가 대표적입니다. 유전 알고리즘(Genetic Algorithm)은 자연의 진화 과정, 즉 자연선택과 돌연변이 같은 메커니즘을 모방하여 최적의 해답을 점진적으로 찾아가는 방법입니다. &quot;자동차 설계를 세대를 거듭하며 개선하여 연료 효율성을 극대화하는 것&quot;이 대표적인 활용 사례입니다. 기계학습(Machine Learning)은 컴퓨터가 훈련 데이터로부터 스스로 패턴을…</description>
      <content:encoded><![CDATA[<p>빅데이터를 활용하는 대표적인 분석 기법들이 있으며, 시험에서는 각 기법의 정의와 적용 사례를 정확히 구분할 수 있는지를 묻습니다. 연관규칙학습(Association Rule Learning)은 데이터 변수 간의 의미 있는 연관관계를 발견하는 분석입니다. "기저귀를 사는 고객이 맥주도 함께 산다"는 유명한 장바구니 분석이 대표적 사례입니다. "커피를 구매한 사람이 탄산음료도 구매할지 예측"하는 것도 연관분석에 해당합니다. 유형분석(Clustering)은 사용자의 특성에 맞게 그룹이나 범주로 나누어 분류하는 것으로, 고객 세분화가 대표적입니다. 유전 알고리즘(Genetic Algorithm)은 자연의 진화 과정, 즉 자연선택과 돌연변이 같은 메커니즘을 모방하여 최적의 해답을 점진적으로 찾아가는 방법입니다. "자동차 설계를 세대를 거듭하며 개선하여 연료 효율성을 극대화하는 것"이 대표적인 활용 사례입니다. 기계학습(Machine Learning)은 컴퓨터가 훈련 데이터로부터 스스로 패턴을 파악하여 새로운 데이터에 대해 예측하는 기술로, 넷플릭스의 영상 추천 시스템이 좋은 예입니다. 회귀분석(Regression)은 하나 이상의 독립변수가 종속변수에 미치는 영향을 선형 관계로 분석하는 방법으로, "기온 변화에 따른 제품 판매량 예측"처럼 수치를 예측할 때 사용합니다. 감정분석(Sentiment Analysis)은 텍스트에서 글쓴이의 감정(긍정/부정)을 분석하는 기법으로, 고객 리뷰 분석이나 소셜미디어 여론 파악에 활용됩니다. 시험에서는 각 기법과 활용 사례가 올바르게 연결되었는지를 묻는 문제가 출제됩니다. 예를 들어 "군집분석으로 자동차 설계를 최적화한다"는 유전 알고리즘의 사례이므로 잘못된 연결입니다. 핵심 요약 &amp; 시험 포인트 분석 기법 설명 활용 예시 연관규칙학습 데이터 변수 간 연관규칙 발견 기저귀와 맥주 동시 구매 패턴 유형분석 사용자 특성에 맞게 그룹/범주 분류 고객 세분화 유전 알고리즘 자연선택·돌연변이 메커니즘으로 점진적 진화 차량 설계 최적화 기계학습 훈련 데이터에서 패턴 파악 후 예측 넷플릭스 추천 회귀분석 선형함수 기반 수치 데이터 분석 기온→판매량 예측 감정분석 텍스트에서 감정(긍정/부정) 추출 고객 리뷰 분석 시험 포인트: 유전 알고리즘은 "최적화" 문제에 사용됩니다. 연관분석은 "장바구니 분석"의 대표 사례입니다. 회귀분석은 연속형 종속변수를 예측할 때 사용합니다. 추천 시스템 (Recommendation System) 빅데이터의 가장 대표적 활용 사례. 넷플릭스·아마존·유튜브 핵심 기술. 1. 협업 필터링 (Collaborative Filtering) 사용자/항목 간 유사성 기반. 종류 원리 예시 사용자 기반(User-based) 비슷한 취향의 사용자가 좋아한 항목 추천 "비슷한 사용자가 본 영화" 아이템 기반(Item-based) 사용자가 좋아한 것과 비슷한 항목 추천 "이 책을 본 사람들이 본 다른 책" 모델 기반 행렬 분해(MF, SVD), 신경망 Netflix Prize 우승 알고리즘 2. 콘텐츠 기반 (Content-based) - 항목의 속성·태그·텍스트로 유사도 계산 - 사용자 프로파일 + 항목 프로파일 매칭 - 예: 유튜브의 동영상 메타데이터 기반 추천 3. 하이브리드 (Hybrid) - 협업 필터링 + 콘텐츠 기반 결합 - 단일 방법의 약점 보완 (Netflix, YouTube) 추천 시스템의 주요 문제 문제 설명 해결 콜드스타트(Cold Start) 새 사용자/항목 정보 없음 인기 항목, 콘텐츠 기반, 인구통계 활용 희소성(Sparsity) 평점 행렬이 대부분 비어있음 행렬 분해, 차원 축소 확장성(Scalability) 사용자·항목 수 증가 시 계산 비용↑ 분산 컴퓨팅, 근사 알고리즘 필터 버블 유사 항목만 추천되어 다양성 감소 무작위성 도입, 다양성 가중치 빅데이터 처리 단계 5단계 단계 활동 주요 도구 1. 수집(Collection) 다양한 소스에서 데이터 확보 Crawler, API, IoT, ETL 2. 저장(Storage) 분산 저장, 데이터 레이크 HDFS, S3, …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터 사이언스와 데이터 사이언티스트</title>
      <link>https://adsp.todaycode.kr/study/11</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/11</guid>
      <pubDate>Thu, 01 Oct 2026 00:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>DBMS</category>
      <category>빅데이터</category>
      <category>데이터 사이언스</category>
      <category>분석 주제 유형</category>
      <category>하향식·상향식 접근</category>
      <category>의사결정나무</category>
      <category>데이터 마트</category>
      <category>데이터 기반 의사결정</category>
      <category>강화학습·지도학습</category>
      <category>SQL</category>
      <category>하둡·빅데이터 인프라</category>
      <description>데이터 사이언스는 정형, 반정형, 비정형 등 다양한 형태의 데이터에서 의미와 가치를 추출하는 학문입니다. 수학, 통계학, 컴퓨터공학, 데이터공학 등을 아우르는 총체적(holistic) 접근법을 사용합니다. 데이터 분석가는 분석 보고서와 시각화 자료를 작성하여 데이터 기반의 의사결정을 돕는 역할을 합니다. 데이터 사이언티스트는 머신러닝 및 AI를 활용하기 위한 코딩 스킬과 통계적 지식을 갖춘 전문가입니다. 필요한 역량은 크게 하드 스킬과 소프트 스킬로 나뉩니다. 하드 스킬에는 머신러닝, 모델링, 데이터 기술 역량 등 기술적 이론 지식이 포함됩니다. 소프트 스킬에는 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션(고객 공감 능력) 등이 포함되며, 이를 통해 통찰력 있는 분석 능력을 발휘합니다. 가트너(Gartner)가 주장한 데이터 사이언티스트의 핵심 역량은 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 네 가지이며, 여기서 주의할 점은 하드 스킬이 포함되지 않는다는 것입니다…</description>
      <content:encoded><![CDATA[<p>데이터 사이언스는 정형, 반정형, 비정형 등 다양한 형태의 데이터에서 의미와 가치를 추출하는 학문입니다. 수학, 통계학, 컴퓨터공학, 데이터공학 등을 아우르는 총체적(holistic) 접근법을 사용합니다. 데이터 분석가는 분석 보고서와 시각화 자료를 작성하여 데이터 기반의 의사결정을 돕는 역할을 합니다. 데이터 사이언티스트는 머신러닝 및 AI를 활용하기 위한 코딩 스킬과 통계적 지식을 갖춘 전문가입니다. 필요한 역량은 크게 하드 스킬과 소프트 스킬로 나뉩니다. 하드 스킬에는 머신러닝, 모델링, 데이터 기술 역량 등 기술적 이론 지식이 포함됩니다. 소프트 스킬에는 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션(고객 공감 능력) 등이 포함되며, 이를 통해 통찰력 있는 분석 능력을 발휘합니다. 가트너(Gartner)가 주장한 데이터 사이언티스트의 핵심 역량은 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 네 가지이며, 여기서 주의할 점은 하드 스킬이 포함되지 않는다는 것입니다. 또한 시험에서 "타인과의 의사소통 능력은 중요하지 않다"는 보기가 나오면 반드시 틀린 것입니다. 데이터 사이언티스트에게 커뮤니케이션 능력은 필수적인 소프트 스킬입니다. 효과적인 분석 모델 개발을 위해서는 인문학적 요소도 중요합니다. 분석 모델이 예측할 수 없는 위험 요소를 지속적으로 판단하고, 모델의 한계에 대해 끊임없이 의구심을 가져야 합니다. 과학 기반의 정량 분석과 인문학적 통찰을 결합한 합리적 추론이 필요하며, 특히 인과관계보다 상관관계 분석 기반의 인사이트가 중요해지고 있습니다. 핵심 요약 &amp; 시험 포인트 데이터 사이언스 - 다양한 형태의 데이터에서 의미/가치를 추출하는 학문 - 총체적(holistic) 접근법: 수학, 통계학, 컴퓨터공학, 데이터공학 등 융합 - 데이터 분석가: 분석 보고서·시각화 자료 작성 → 데이터 기반 의사결정 데이터 사이언티스트 역량 구분 내용 하드 스킬 Machine Learning, Modeling, Data Technical Skill 소프트 스킬 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션 시험 포인트: - 가트너 주장 역량: 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 (하드 스킬 제외) - 의사소통 능력은 중요합니다 — "의사소통이 중요하지 않다"는 틀린 설명 (47회 출제) - 인문학적 요소: 분석 모델의 한계를 끊임없이 고찰, '상관관계' 분석 기반 인사이트 중시 가치 패러다임의 변화 데이터 사이언티스트 역량 — Hard Skills vs Soft Skills Hard Skills (분석 기술 역량) 영역 세부 역량 통계·수학 통계학, 선형대수, 미적분 머신러닝 지도/비지도 학습 알고리즘, 평가 분석 도구 R, Python, SQL, Spark 빅데이터 인프라 Hadoop, Spark, NoSQL, 클라우드 데이터 엔지니어링 ETL, 데이터 파이프라인 Soft Skills (커뮤니케이션·통찰 역량) 영역 세부 역량 비즈니스 도메인 지식 산업 이해, 도메인 인사이트 호기심·창의력 문제 정의, 가설 수립 스토리텔링 분석 결과를 이해하기 쉽게 전달 시각화 비전문가도 이해할 수 있는 그래프 협업·소통 다양한 부서·전문가와 협업 시험 포인트: ADsP에서 "데이터 사이언티스트는 Hard Skills만 갖추면 된다"는 보기는 틀림. Soft Skills가 동등하게 중요. 통찰력·스토리텔링·창의성이 핵심. 추가 핵심 개념 — 데이터 사이언티스트의 역할 확장 - CDO(Chief Data Officer): 조직의 데이터 전략·자산을 총괄하는 임원으로 데이터 거버넌스의 최상위 책임자. - Data Owner: 특정 데이터 도메인의 비즈니스 책임자(현업 부서). 데이터 정의·접근 권한 결정. - Data Steward: 데이터 품질·표준·메타데이터를 실무적으로 관리하는 역할(분석가·DBA 협업). - Data Custodian: 데이터 저장·보안·백업·운영을 책임지는 IT 기술 담당. - 알고리즈미스트(Algorithmist): 알고리즘의 공정성·투명성을 감시하고 피해자 입장에서 알고리즘…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>빅데이터 시대의 위기와 개인정보 비식별화</title>
      <link>https://adsp.todaycode.kr/study/12</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/12</guid>
      <pubDate>Wed, 30 Sep 2026 23:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>빅데이터</category>
      <category>개인정보</category>
      <category>분석 기획</category>
      <description>빅데이터 시대에는 세 가지 주요 위기 요인이 있습니다. 첫째, 사생활 침해입니다. 대량의 개인정보가 수집·분석되면서 개인의 프라이버시가 위협받을 수 있습니다. 이에 대한 통제 방안으로 정보 제공자의 동의제에서 데이터 사용자의 책임제로 전환하는 것이 논의되고 있습니다. 여기서 주의할 점은 &quot;익명화 기술로 사생활 침해를 완전히 해결할 수 있다&quot;는 설명은 틀렸다는 것입니다. 익명화 기술은 도움이 되지만 완전한 해결책은 아닙니다. 둘째, 책임 원칙 훼손입니다. 예측 알고리즘이 발달하면서 실제 행위가 아닌 잠재적 성향만으로 불이익을 받는 등 &apos;행위에 따른 책임&apos;이라는 원칙이 흔들릴 수 있습니다. 이에 대한 통제 방안은 결과 기반 책임 원칙을 고수하는 것입니다. 셋째, 데이터 오용입니다. 데이터를 과신하거나 잘못된 지표로 해석해 그릇된 판단을 내릴 위험이 있으며, 이에 대해서는 알고리즘 접근권을 허용하고 객관적인 인증 방안을 도입하는 것(알고리즈미스트)이 통제 방안입니다. 개인정보 비식별화 기…</description>
      <content:encoded><![CDATA[<p>빅데이터 시대에는 세 가지 주요 위기 요인이 있습니다. 첫째, 사생활 침해입니다. 대량의 개인정보가 수집·분석되면서 개인의 프라이버시가 위협받을 수 있습니다. 이에 대한 통제 방안으로 정보 제공자의 동의제에서 데이터 사용자의 책임제로 전환하는 것이 논의되고 있습니다. 여기서 주의할 점은 "익명화 기술로 사생활 침해를 완전히 해결할 수 있다"는 설명은 틀렸다는 것입니다. 익명화 기술은 도움이 되지만 완전한 해결책은 아닙니다. 둘째, 책임 원칙 훼손입니다. 예측 알고리즘이 발달하면서 실제 행위가 아닌 잠재적 성향만으로 불이익을 받는 등 '행위에 따른 책임'이라는 원칙이 흔들릴 수 있습니다. 이에 대한 통제 방안은 결과 기반 책임 원칙을 고수하는 것입니다. 셋째, 데이터 오용입니다. 데이터를 과신하거나 잘못된 지표로 해석해 그릇된 판단을 내릴 위험이 있으며, 이에 대해서는 알고리즘 접근권을 허용하고 객관적인 인증 방안을 도입하는 것(알고리즈미스트)이 통제 방안입니다. 개인정보 비식별화 기술도 중요한 시험 주제입니다. 범주화(Generalization)는 상세한 값을 일반적인 범주로 바꾸는 기법으로, 예를 들어 "25세"를 "20대"로 변환합니다. 가명처리(Pseudonymization)는 실제 정보 대신 가짜 이름이나 값으로 대체하는 기법입니다. 총계처리(Aggregation)는 개별 값 대신 전체 집계 값(합계, 평균 등)을 사용하는 기법입니다. 데이터 마스킹(Data Masking)은 특정 식별 가능한 데이터 값을 다른 값으로 대체하는 기법입니다. 시험에서 "데이터 마스킹은 특정 데이터 값을 삭제하는 기법"이라는 보기가 나오면, 삭제가 아닌 대체이므로 주의해야 합니다. 이 밖에도 데이터 삭제(Data Suppression)는 식별 가능한 정보를 완전히 제거하는 기법이며, 랜덤 라운딩(Random Rounding)은 수치 데이터를 무작위로 올리거나 내려 정확한 값을 숨기는 기법입니다. 재배열(Shuffling)은 데이터 속성값을 같은 열 내에서 무작위로 섞어 연결 고리를 끊는 기법입니다. 제2과목 — 데이터 분석 기획 핵심 요약 &amp; 시험 포인트 위기 요인 통제 방안 사생활 침해 동의제 → 책임제로 전환 책임 원칙 훼손 결과 기반 책임 원칙 고수 데이터 오용 알고리즘 접근권 허용, 객관적 인증 방안 도입 (알고리즈미스트) 시험 포인트: "익명화 기술로 사생활 침해를 완전 해결할 수 있다"는 틀린 설명입니다 (44회 출제). 위기 요인과 통제 방안의 연결을 정확히 외워야 합니다. 빅데이터 시대의 위기 요인 3가지 + 통제 방안 위기 내용 통제 방안 사생활 침해 (Privacy Invasion) 무분별한 개인정보 수집·결합으로 익명성 상실 동의제 → 책임제 전환, 비식별화 강화 책임 원칙 훼손 (Accountability Erosion) 알고리즘 자동 판단의 책임 소재 모호 결과 기반 책임 부과, 감사 가능성 데이터 오용 (Data Misuse) 잘못된 분석·해석으로 그릇된 의사결정 알고리즘 접근권 보장, 투명성 확보 사생활 침해 - 사례 - 통신사 위치 데이터로 개인 행적 추적 - SNS 공개 정보 결합으로 신원 식별 책임 원칙 훼손 - 사례 - AI 채용 알고리즘이 특정 집단을 차별 - 자율주행차 사고 시 책임 소재 불명 데이터 오용 - 사례 - 잘못된 모델로 보험료 차별 산정 - 통계적 편향이 있는 데이터로 의사결정 시험 포인트: 위기 3가지(사생활/책임/오용)와 각 통제 방안의 매핑이 자주 출제됨. "동의제→책임제", "결과 기반 책임", "알고리즘 접근권"은 빈출 키워드. 추가 핵심 개념 — 프라이버시 보호 모델 (k-익명성·l-다양성·t-근접성) - k-익명성(k-Anonymity): 동일한 준식별자(Quasi-identifier: 나이·성별·우편번호 등) 조합을 가진 레코드가 데이터셋에 최소 k개 이상 존재하도록 보장하는 비식별화 모델. k가 클수록 프라이버시 ↑, 데이터 유용성 ↓. - l-다양성(l-Diversity): k-익명성의 "동질성 공격"(같은 그룹 내 민감 속성이 모두 동일하면 추론 가능) 취약점…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 기획의 개념과 고려사항</title>
      <link>https://adsp.todaycode.kr/study/13</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/13</guid>
      <pubDate>Wed, 30 Sep 2026 22:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>빅데이터 활용</category>
      <category>분석 기획</category>
      <category>분석 주제 유형</category>
      <category>분석 방법론</category>
      <category>우선순위 평가</category>
      <category>분석 성숙도</category>
      <category>데이터 거버넌스</category>
      <category>IoT·플랫폼</category>
      <category>데이터 품질</category>
      <description>분석 기획이란 데이터 분석을 수행하기에 앞서 무엇을 분석할 것인지(과제 정의), 어떻게 관리할 것인지(관리 방안)를 사전에 계획하는 작업입니다. 성공적인 분석 프로젝트를 위해서는 기술적 역량뿐만 아니라 균형 잡힌 시각이 필요합니다. 분석 기획 시 반드시 고려해야 할 세 가지 사항이 있습니다. 첫째, 가용한 데이터입니다. 분석에 필요한 데이터를 확보할 수 있는지, 그 데이터가 정형인지 반정형인지 비정형인지를 사전에 파악해야 합니다. 데이터가 없다면 아무리 좋은 분석 기법도 쓸모가 없기 때문입니다. 둘째, 적절한 유스케이스입니다. 처음부터 모든 것을 새로 만들기보다는 기존에 수립된 유사한 분석 시나리오나 솔루션을 최대한 활용하는 것이 효율적입니다. 셋째, 장애요소 확인입니다. 분석을 방해할 수 있는 요소들(데이터 부족, 기술 한계, 조직 저항 등)을 미리 파악하고 대응 계획을 수립해야 합니다. 시험에서 &quot;고려사항이 아닌 것&quot;을 묻는 문제가 자주 출제됩니다. &quot;최신 분석 기법으로 분석을 …</description>
      <content:encoded><![CDATA[<p>분석 기획이란 데이터 분석을 수행하기에 앞서 무엇을 분석할 것인지(과제 정의), 어떻게 관리할 것인지(관리 방안)를 사전에 계획하는 작업입니다. 성공적인 분석 프로젝트를 위해서는 기술적 역량뿐만 아니라 균형 잡힌 시각이 필요합니다. 분석 기획 시 반드시 고려해야 할 세 가지 사항이 있습니다. 첫째, 가용한 데이터입니다. 분석에 필요한 데이터를 확보할 수 있는지, 그 데이터가 정형인지 반정형인지 비정형인지를 사전에 파악해야 합니다. 데이터가 없다면 아무리 좋은 분석 기법도 쓸모가 없기 때문입니다. 둘째, 적절한 유스케이스입니다. 처음부터 모든 것을 새로 만들기보다는 기존에 수립된 유사한 분석 시나리오나 솔루션을 최대한 활용하는 것이 효율적입니다. 셋째, 장애요소 확인입니다. 분석을 방해할 수 있는 요소들(데이터 부족, 기술 한계, 조직 저항 등)을 미리 파악하고 대응 계획을 수립해야 합니다. 시험에서 "고려사항이 아닌 것"을 묻는 문제가 자주 출제됩니다. "최신 분석 기법으로 분석을 진행한다"는 고려사항이 아닙니다. 분석 기획은 최신 기법을 쓰는 것이 목적이 아니라, 적절한 기법으로 문제를 해결하는 것이 목적이기 때문입니다. 또한 "데이터 정합성 검증"은 기획 단계가 아닌 데이터 준비 단계에서 수행하는 작업이므로, 분석 기획의 고려사항에 포함되지 않습니다. 핵심 요약 &amp; 시험 포인트 고려사항 내용 가용한 데이터 데이터 확보 및 유형 분석 사전 시행 (정형/반정형/비정형) 적절한 유스케이스 기존 유사 분석 시나리오·솔루션 최대한 활용 장애요소 확인 분석 방해 요소에 대한 사전 계획 수립 시험 포인트: "최신 분석 기법으로 분석 진행"은 고려사항이 아닙니다 (45회 출제). "데이터 정합성 검증"도 기획 단계가 아닌 데이터 준비 단계입니다. 분석 기획 4가지 주요 영역 (Domain) 영역 내용 점검 항목 데이터(Data) 분석에 활용 가능한 데이터 식별 가용성, 품질, 거버넌스 시스템(System) 분석을 위한 IT 인프라·도구 컴퓨팅 자원, 분석 플랫폼 인력(Manpower) 분석가·도메인 전문가 역량 조직 구조, 스킬셋, 외부 협력 제도(Method/Procedure) 정책·프로세스·거버넌스 데이터 정책, 보안, 품질 관리 분석 기획 시 유의사항 1. 분석 결과 활용 방안 우선 정의 - "무엇을 알고 싶은가?"보다 "분석 결과를 어떻게 사용할 것인가?"가 먼저 - 액션이 없는 분석은 가치 없음 2. 데이터 가용성·품질 확인 - 필요한 데이터가 있는가? 품질이 충분한가? - 외부 데이터 구매 필요성 검토 3. 분석 결과의 비즈니스 가치 정량화 - 매출 증가, 비용 절감, 리스크 감소 등 KPI 연결 - ROI(투자 수익률) 추정 4. 변화 관리(Change Management) - 새로운 분석 결과를 받아들이는 조직의 준비도 - 의사결정 프로세스 변경의 영향 - 직원 교육·소통 계획 분석 기획 단계 - 요구사항 정의 → 데이터 정의 → 방법론 결정 → 성공 기준 설정 → 이행 계획 시험 포인트: 분석 기획 4영역(데이터·시스템·인력·제도). "분석 결과의 활용 방안"을 먼저 정의하는 것이 핵심. 분석 기획의 본질적 질문 - Why: 왜 이 분석을 하는가 (목적·비즈니스 가치) - What: 무엇을 분석할 것인가 (대상·범위) - How: 어떻게 분석할 것인가 (방법·도구·인력) - So-What(정성 성과): 분석 결과가 의사결정·행동에 어떤 의미를 주는가 — 결과를 통찰로 전환 분석 시작점 명확화 - 해결할 문제 명확화(Why): 모호한 "데이터로 뭐 할 수 있을까?"가 아닌 구체적 문제로 정의 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - So-What — 분석 결과가 의사결정·행동에 어떤 의미를 주는가 — 결과를 통찰로 전환 - 해결할 문제 명확화 — 모호한 "데이터로 뭐 할 수 있을까?"가 아닌 구체적 문제로 정의 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 주제 유형 4가지</title>
      <link>https://adsp.todaycode.kr/study/14</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/14</guid>
      <pubDate>Wed, 30 Sep 2026 21:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>분석 주제 유형</category>
      <description>분석 주제 유형은 &quot;분석 대상(What)을 아는가?&quot;와 &quot;분석 방법(How)을 아는가?&quot;라는 두 축으로 구분되는 2×2 매트릭스입니다. 이 개념은 4447회 모든 회차에서 출제된 최빈출 주제입니다. 분석 대상도 알고 분석 방법도 아는 경우는 최적화(Optimization)입니다. 이미 무엇을 분석해야 하는지도 알고 어떻게 분석해야 하는지도 아는 상태이므로, 기존 방법을 더욱 정교하게 다듬어 최적의 결과를 얻는 데 집중합니다. 분석 대상은 알지만 분석 방법을 모르는 경우는 솔루션(Solution)입니다. 무엇이 문제인지는 파악했지만 어떻게 해결할지 모르는 상태이므로, 적절한 분석 방법을 찾는 것이 과제입니다. 분석 대상은 모르지만 분석 방법은 아는 경우는 통찰(Insight)입니다. 분석 기법은 보유하고 있으나 그것을 어디에 적용할지 모르는 상태이므로, 분석 대상을 발굴하는 것이 핵심입니다. 분석 대상도 모르고 분석 방법도 모르는 경우는 발견(Discovery)입니다. 무엇을 어떻게 …</description>
      <content:encoded><![CDATA[<p>분석 주제 유형은 "분석 대상(What)을 아는가?"와 "분석 방법(How)을 아는가?"라는 두 축으로 구분되는 2×2 매트릭스입니다. 이 개념은 4447회 모든 회차에서 출제된 최빈출 주제입니다. 분석 대상도 알고 분석 방법도 아는 경우는 최적화(Optimization)입니다. 이미 무엇을 분석해야 하는지도 알고 어떻게 분석해야 하는지도 아는 상태이므로, 기존 방법을 더욱 정교하게 다듬어 최적의 결과를 얻는 데 집중합니다. 분석 대상은 알지만 분석 방법을 모르는 경우는 솔루션(Solution)입니다. 무엇이 문제인지는 파악했지만 어떻게 해결할지 모르는 상태이므로, 적절한 분석 방법을 찾는 것이 과제입니다. 분석 대상은 모르지만 분석 방법은 아는 경우는 통찰(Insight)입니다. 분석 기법은 보유하고 있으나 그것을 어디에 적용할지 모르는 상태이므로, 분석 대상을 발굴하는 것이 핵심입니다. 분석 대상도 모르고 분석 방법도 모르는 경우는 발견(Discovery)입니다. 무엇을 어떻게 해야 할지 모두 불분명한 상태이므로, 탐색적 접근을 통해 새로운 패턴이나 인사이트를 발견하는 것이 목표입니다. 핵심 요약 &amp; 시험 포인트 분석 대상 Known 분석 대상 Un-Known 분석 방법 Known 최적화 (Optimization) 통찰 (Insight) 분석 방법 Un-Known 솔루션 (Solution) 발견 (Discovery) 시험 포인트: 이 2×2 매트릭스는 4447회 매회 출제되는 핵심 주제입니다. - 대상 Known + 방법 Unknown = 솔루션 (47회 출제) - 대상 Unknown + 방법 Known = 통찰 (45회 출제) - 대상 Known + 방법 Known = 최적화 (46회 출제)</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 과제 도출 — 하향식과 상향식 접근법</title>
      <link>https://adsp.todaycode.kr/study/15</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/15</guid>
      <pubDate>Wed, 30 Sep 2026 20:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>분석 주제 유형</category>
      <category>하향식·상향식 접근</category>
      <category>비즈니스 모델 캔버스</category>
      <category>강화학습·지도학습</category>
      <description>분석 과제를 도출하는 방법은 크게 하향식(Top-Down)과 상향식(Bottom-Up) 두 가지가 있습니다. 하향식 접근법은 해결해야 할 문제가 명확한 경우에 사용합니다. 체계적으로 단계를 나누어 문제를 해결하며, 분석 주제 유형 중 &apos;최적화&apos;와 &apos;솔루션&apos;에 해당할 때 적합합니다. 진행 순서는 문제 탐색→문제 정의→해결 방안 탐색→타당성 검토입니다. 문제 탐색 단계에서는 비즈니스 모델 기반 탐색(비즈니스 모델 캔버스의 9가지 블록을 5가지로 단순화하여 활용), 외부 참조 모델 기반 탐색(다른 기업의 성공 사례를 벤치마킹), 분석 유즈케이스(비즈니스 문제를 데이터 분석 문제로 전환)의 세 가지 기법을 사용합니다. &quot;데이터 기반 탐색&quot;은 하향식이 아닌 상향식 접근법의 특징이므로 주의해야 합니다. 상향식 접근법은 문제가 불분명한 경우에 사용합니다. 데이터를 먼저 탐색하여 인사이트와 지식을 얻는 Bottom-Up 방식이며, 분석 주제 유형 중 &apos;통찰&apos;과 &apos;발견&apos;에 해당합니다. 프로토타이핑 …</description>
      <content:encoded><![CDATA[<p>분석 과제를 도출하는 방법은 크게 하향식(Top-Down)과 상향식(Bottom-Up) 두 가지가 있습니다. 하향식 접근법은 해결해야 할 문제가 명확한 경우에 사용합니다. 체계적으로 단계를 나누어 문제를 해결하며, 분석 주제 유형 중 '최적화'와 '솔루션'에 해당할 때 적합합니다. 진행 순서는 문제 탐색→문제 정의→해결 방안 탐색→타당성 검토입니다. 문제 탐색 단계에서는 비즈니스 모델 기반 탐색(비즈니스 모델 캔버스의 9가지 블록을 5가지로 단순화하여 활용), 외부 참조 모델 기반 탐색(다른 기업의 성공 사례를 벤치마킹), 분석 유즈케이스(비즈니스 문제를 데이터 분석 문제로 전환)의 세 가지 기법을 사용합니다. "데이터 기반 탐색"은 하향식이 아닌 상향식 접근법의 특징이므로 주의해야 합니다. 상향식 접근법은 문제가 불분명한 경우에 사용합니다. 데이터를 먼저 탐색하여 인사이트와 지식을 얻는 Bottom-Up 방식이며, 분석 주제 유형 중 '통찰'과 '발견'에 해당합니다. 프로토타이핑 접근법을 통해 빠르게 시제품을 만들고 반복적으로 개선해나가는 것이 특징입니다. 비지도학습과 유사한 탐색적 분석 방식을 사용합니다. 시험에서 "문제가 명확히 정의되어 있는 경우 답을 찾는 기법"이라는 보기가 나오면 이것은 하향식 접근법의 설명이므로, 상향식과 혼동하지 않아야 합니다. 추가 핵심 개념 — 디자인 사고와 비즈니스 모델 캔버스 - 디자인 사고(Design Thinking): 상향식(발산: 다양한 아이디어 탐색)과 하향식(수렴: 분석·검증)을 반복해 창의적 해결책을 도출하는 사용자 중심 방법론. 스탠퍼드 d.school·IDEO에서 정형화한 5단계. - ① 공감(Empathize) — 사용자 관찰·인터뷰 - ② 정의(Define) — 문제 재정의 - ③ 발상(Ideate) — 아이디어 발산 - ④ 프로토타입(Prototype) — 빠른 시제품 제작 - ⑤ 테스트(Test) — 검증·반복 - BMC(Business Model Canvas, 비즈니스 모델 캔버스): 9개 블록(가치 제안·고객 세그먼트·채널·고객 관계·수익 흐름·핵심 자원·핵심 활동·핵심 파트너·비용 구조)을 분석 과제 발굴 관점에서 5대 영역으로 단순화: - ① 업무(Operation), ② 제품/서비스(Product), ③ 고객(Customer), ④ 규제와 감사(Regulation &amp; Audit), ⑤ 지원 인프라(Support Infrastructure) - Quick-Win 전략: 시급성↑·난이도↓ 사분면의 과제를 1순위로 수행하여 빠른 가치 입증·내부 신뢰 확보. 시험 핵심: 디자인 사고의 5단계 순서와 BMC 5대 분석 영역은 자주 출제됩니다. 디자인 사고 (Design Thinking) - 빅데이터 분석에서는 하향식(Top-down)·상향식(Bottom-up)을 디자인 사고의 발산(Divergent) - 수렴(Convergent) 사이클로 결합 - 발산: 가능한 한 많은 아이디어·가설·과제 후보를 도출 (브레인스토밍·페인포인트 식별) - 수렴: 평가 기준으로 우선순위·실행 과제 선택 - 공감 → 정의 → 아이디어 → 프로토타입 → 테스트의 5단계 반복 과제 발굴 용어 - Quick Win(퀵윈): 단기에 빠르게 가시적 성과를 낼 수 있는 과제 — 초기 신뢰 확보 - Pain Point(페인 포인트): 사용자/업무가 겪는 구체적 불편·문제 - Use Case(유스케이스): 비즈니스 가치를 만들어내는 구체적 활용 시나리오 - 분석 기회 발굴: 페인포인트·외부 사례·벤치마킹으로 분석 가치를 만들 영역 식별 - What-if 분석: "만약 라면?"의 시나리오 분석 — 처방 분석의 일부 표기 변형 (공백 포함/제외) - 디자인사고 / 디자인 사고(Design Thinking): 둘 다 통용되는 표기 - 하향식접근법 / 하향식 접근법(Top-down Approach): 문제 정의 → 가설 → 데이터 → 검증 - 상향식접근법 / 상향식 접근법(Bottom-up Approach): 데이터 탐색 → 패턴 발견 → 인사이트 - ADsP 시험에서는 공백 없는 형태로도 자주 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 방법론 — 폭포수·나선형·프로토타입·KDD·CRISP-DM</title>
      <link>https://adsp.todaycode.kr/study/16</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/16</guid>
      <pubDate>Wed, 30 Sep 2026 19:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>데이터베이스</category>
      <category>분석 주제 유형</category>
      <category>하향식·상향식 접근</category>
      <category>분석 방법론</category>
      <category>KDD</category>
      <category>CRISP-DM</category>
      <category>SEMMA</category>
      <category>폭포수 모델</category>
      <category>나선형 모델</category>
      <category>프로토타입</category>
      <category>기술통계</category>
      <category>표본추출</category>
      <category>군집분석</category>
      <category>차원 축소</category>
      <category>데이터 전처리</category>
      <category>데이터 마이닝</category>
      <category>데이터 마트</category>
      <category>이상치·결측</category>
      <category>MLOps·최신 ML</category>
      <description>분석 방법론은 데이터 분석 프로젝트를 체계적으로 수행하기 위한 절차와 방법을 정한 것입니다. 폭포수(Waterfall) 모형은 가장 고전적이고 전통적인 개발 모형으로, 요구분석→설계→구현→테스트→유지보수를 한 방향으로 순차적으로 진행합니다. 각 단계가 완료된 후 다음 단계로 넘어가며, 문제가 발생하면 이전 단계로 피드백하여 수정합니다. 나선형(Spiral) 모형은 계획 수립→위험 분석→개발 및 검증→고객 평가의 네 단계를 반복하며 점진적으로 시스템을 완성하는 방법입니다. 위험 분석을 중요시하며 유지보수가 필요 없다는 장점이 있지만, 효과적인 관리 체계가 없으면 복잡도가 급격히 상승할 수 있습니다. 프로토타입(Prototype) 모형은 사용자의 요구사항이 불분명할 때 먼저 시제품을 만들어 결과를 예측하고, 그 결과를 바탕으로 반복적으로 개선하는 상향식 접근법입니다. KDD(Knowledge Discovery in Database)는 데이터베이스에서 유용한 지식을 발견하는 과정으로, 데…</description>
      <content:encoded><![CDATA[<p>분석 방법론은 데이터 분석 프로젝트를 체계적으로 수행하기 위한 절차와 방법을 정한 것입니다. 폭포수(Waterfall) 모형은 가장 고전적이고 전통적인 개발 모형으로, 요구분석→설계→구현→테스트→유지보수를 한 방향으로 순차적으로 진행합니다. 각 단계가 완료된 후 다음 단계로 넘어가며, 문제가 발생하면 이전 단계로 피드백하여 수정합니다. 나선형(Spiral) 모형은 계획 수립→위험 분석→개발 및 검증→고객 평가의 네 단계를 반복하며 점진적으로 시스템을 완성하는 방법입니다. 위험 분석을 중요시하며 유지보수가 필요 없다는 장점이 있지만, 효과적인 관리 체계가 없으면 복잡도가 급격히 상승할 수 있습니다. 프로토타입(Prototype) 모형은 사용자의 요구사항이 불분명할 때 먼저 시제품을 만들어 결과를 예측하고, 그 결과를 바탕으로 반복적으로 개선하는 상향식 접근법입니다. KDD(Knowledge Discovery in Database)는 데이터베이스에서 유용한 지식을 발견하는 과정으로, 데이터셋 선택→데이터 전처리(노이즈, 이상값, 결측치 제거)→데이터 변환(차원 축소)→데이터마이닝→해석 및 평가의 순서로 진행됩니다. CRISP-DM(Cross Industry Standard Process for Data Mining)은 산업 표준 데이터마이닝 방법론으로, 업무 이해→데이터 이해→데이터 준비→모델링→평가→전개의 6단계로 구성됩니다. 시험에서는 첫 번째 단계가 반드시 "업무 이해"라는 점을 기억해야 하며, "데이터 이해"나 "데이터 준비"가 먼저 오는 보기는 틀립니다. CRISP-DM은 순환적(Iterative) 구조로, 전개(Deployment) 단계 이후에도 새로운 비즈니스 요구나 데이터 변화에 따라 다시 업무 이해 단계로 되돌아가 반복 개선할 수 있습니다. SEMMA(Sample→Explore→Modify→Model→Assess)는 SAS Institute에서 개발한 데이터마이닝 방법론으로, 5단계로 구성됩니다. Sample(표본추출)은 분석 가능한 크기의 데이터 표본을 추출하는 단계입니다. Explore(탐색)은 시각화와 기술통계로 데이터의 특성과 이상값을 파악하는 단계입니다. Modify(수정)은 변수 변환, 결측치 처리, 파생 변수 생성 등 데이터를 정제하는 단계입니다. Model(모델링)은 예측·분류 모델을 구축하는 단계입니다. Assess(평가)는 모델 성능을 평가하고 검증하는 단계입니다. SEMMA는 SAS 분석 도구에 특화된 방법론으로, KDD·CRISP-DM과 함께 3대 데이터마이닝 방법론으로 시험에 출제됩니다. 핵심 요약 &amp; 시험 포인트 데이터마이닝 3대 방법론 비교 방법론 개발 단계 KDD 학술 분야 선택→전처리→변환→마이닝→해석/평가 (5단계) CRISP-DM 산업 표준 업무이해→데이터이해→데이터준비→모델링→평가→전개 (6단계) SEMMA SAS Institute Sample→Explore→Modify→Model→Assess (5단계) 시험 포인트: CRISP-DM 첫 번째 단계는 반드시 "업무 이해" 입니다. KDD는 "데이터셋 선택"으로 시작합니다. SEMMA는 "표본추출(Sample)"로 시작합니다. 추가 포인트: CRISP-DM은 6단계가 순환적(Iterative)으로 운영됩니다. 전개 후에도 업무 이해 단계로 되돌아갈 수 있습니다 — 이 점이 KDD(선형 절차)와의 차이점입니다. 분석 방법론의 구성 - 방법론의 구성: 단계(Phase) 태스크(Task) 스텝(Step) 계층 구조 - 단계별 산출물: 각 단계 종료 시 산출되는 문서·모델·결정 사항 - 반복적 모형(Iterative): 단계를 반복하며 점진적으로 완성 — 애자일과 유사 Box-Jenkins 절차 (ARIMA 모형 구축) - Box-Jenkins: ARIMA 모형 식별·추정·진단의 반복 절차 - 모형 식별(Identification): ACF·PACF로 (p, d, q) 결정 - 모형 추정(Estimation): MLE로 계수 추정 - 모형 진단(Diagnostic): 잔차의 백색잡음 여부 확인 — Ljung-Box·Philli…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터 분석 방법론과 프로세스</title>
      <link>https://adsp.todaycode.kr/study/17</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/17</guid>
      <pubDate>Wed, 30 Sep 2026 18:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>분석 기획</category>
      <category>분석 방법론</category>
      <category>분석 프로젝트 관리</category>
      <category>탐색적 분석</category>
      <category>데이터 마트</category>
      <category>MLOps·최신 ML</category>
      <category>데이터 수집</category>
      <description>데이터 분석 방법론은 단계(Phase), 태스크(Task), 스텝(Step)의 세 개 계층으로 구성됩니다. 전체 프로세스는 분석 기획→데이터 준비→데이터 분석→시스템 구현→평가 및 전개의 5단계로 진행됩니다. 분석 기획 단계에서는 비즈니스를 이해하고 분석의 범위를 설정하며, 프로젝트를 정의하고 위험(Risk) 대응 계획을 수립합니다. 이때 SOW(Statement of Work, 작업기술서)를 통해 고객의 요구사항과 예상 결과를 세부적으로 기술하고, WBS(Work Breakdown Structure, 업무분업구조도)를 통해 전체 업무를 분류하여 각 담당자에게 업무를 분할합니다. 위험 대응 방안으로는 회피(위험 자체를 제거), 전이(보험 등으로 책임 이전), 완화(위험 영향을 축소), 수용(위험을 인정하고 감수)의 네 가지가 있습니다. 데이터 준비 단계에서는 필요한 데이터를 정의하고 수집하며, 데이터의 정합성을 점검합니다. 데이터 수집 방법으로는 웹 크롤링(웹 데이터 자동 수집), …</description>
      <content:encoded><![CDATA[<p>데이터 분석 방법론은 단계(Phase), 태스크(Task), 스텝(Step)의 세 개 계층으로 구성됩니다. 전체 프로세스는 분석 기획→데이터 준비→데이터 분석→시스템 구현→평가 및 전개의 5단계로 진행됩니다. 분석 기획 단계에서는 비즈니스를 이해하고 분석의 범위를 설정하며, 프로젝트를 정의하고 위험(Risk) 대응 계획을 수립합니다. 이때 SOW(Statement of Work, 작업기술서)를 통해 고객의 요구사항과 예상 결과를 세부적으로 기술하고, WBS(Work Breakdown Structure, 업무분업구조도)를 통해 전체 업무를 분류하여 각 담당자에게 업무를 분할합니다. 위험 대응 방안으로는 회피(위험 자체를 제거), 전이(보험 등으로 책임 이전), 완화(위험 영향을 축소), 수용(위험을 인정하고 감수)의 네 가지가 있습니다. 데이터 준비 단계에서는 필요한 데이터를 정의하고 수집하며, 데이터의 정합성을 점검합니다. 데이터 수집 방법으로는 웹 크롤링(웹 데이터 자동 수집), API(프로그램 간 데이터 교환 규칙), ETL(Extract-Transform-Load, 데이터 추출→변환→적재)이 있습니다. 데이터 분석 단계에서는 탐색적 데이터 분석(EDA)을 통해 데이터의 특성을 파악하고, 데이터를 훈련용 학습 데이터와 검증용 실험 데이터로 분할한 후 모델링과 검증을 수행합니다. 시스템 구현 단계에서는 분석 결과를 실제 시스템으로 설계하고 구현하며, 단순한 분석 프로젝트의 경우 이 단계를 생략할 수 있습니다. 마지막으로 평가 및 전개 단계에서는 모델의 발전 계획을 수립하고 프로젝트를 평가 및 보고하며, 지속적인 교육과 활용을 통해 조직의 분석 역량을 내재화합니다. 핵심 요약 &amp; 시험 포인트 단계(Phase) → 태스크(Task) → 스텝(Step) 의 3개 층으로 구성됩니다. 단계 핵심 내용 주요 용어 분석 기획 비즈니스 이해, 범위 설정, 프로젝트 정의, 위험 계획 SOW(작업기술서), WBS(업무분업구조도) 데이터 준비 데이터 정의, 수집, 정합성 점검 웹 크롤링, API, ETL 데이터 분석 탐색적 분석, 모델링, 평가/검증 EDA, 훈련/검증 데이터 분할 시스템 구현 설계, 구현, 테스트, 운영 단순 분석 프로젝트는 이 단계 생략 가능 평가 및 전개 모델 발전 계획, 프로젝트 평가/보고 조직 역량 내재화 시험 포인트: 분석 프로세스 순서는 분석 기획→데이터 준비→데이터 분석→시스템 구현→평가 및 전개 (44회 출제). 위험 대응 방안은 회피, 전이, 완화, 수용 4가지입니다. 추가 핵심 개념 — 프로젝트 관리 도구 - PMBOK(Project Management Body of Knowledge): PMI가 발간하는 프로젝트 관리 표준 지식체계. 5대 프로세스 그룹(착수·계획·실행·통제·종료)과 10대 지식 영역(범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자·통합). - WBS(Work Breakdown Structure, 작업분류체계): 프로젝트 전체 범위를 관리 가능한 소규모 작업(Work Package)으로 계층적으로 분해한 구조(100% 규칙). - 간트차트(Gantt Chart): 작업 일정을 시간 축에 막대로 시각화한 도구. 작업 시작·종료·기간 한눈에 파악. - CPM(Critical Path Method, 임계 경로법): 작업 간 선후 의존을 분석해 프로젝트 완료에 필요한 최단 경로(임계 경로)를 찾는 일정 관리 기법. - PERT(Program Evaluation Review Technique): 불확실한 작업 시간을 낙관·비관·최빈으로 3점 추정하여 일정 분포를 산출. - 애자일(Agile) / 스크럼(Scrum): 24주 단위 스프린트(Sprint)로 반복적·점진적 개발. 일일 스탠드업·백로그·번다운 차트 활용. 변화 대응에 강점. 시험 핵심: PMBOK 10대 영역과 WBS·간트·CPM·PERT의 차이가 프로젝트 관리 단원의 핵심입니다. 검증·실행 단계 용어 - PoC(Proof of Concept): 개념 증명 — 핵심 아이디어가 실제로 동작하는지 소규모로 검증 - 파일럿…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 프로젝트와 과제 정의서</title>
      <link>https://adsp.todaycode.kr/study/18</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/18</guid>
      <pubDate>Wed, 30 Sep 2026 17:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>분석 과제 정의서</category>
      <category>우선순위 평가</category>
      <category>분석 프로젝트 관리</category>
      <category>모형 평가</category>
      <category>분류 임계값</category>
      <description>분석 프로젝트는 비즈니스 영역과 데이터 영역의 현황을 파악하고 구성원과 협업하여 진행합니다. 주로 애자일(Agile) 방식으로 관리하며, 분석 과제 정의서를 기반으로 프로젝트를 수행합니다. 분석 과제 정의서에는 분석에 필요한 소스 데이터, 분석 방법, 데이터 입수 및 분석 난이도, 분석 수행 주기, 분석 결과에 대한 검증 방법 등이 포함됩니다. 이해관계자들이 프로젝트의 방향을 설정하고 성공 여부를 판단하기 위한 명확한 기준을 제공하는 문서입니다. 시험에서 &quot;활용 데이터는 내부 데이터로만 제한해야 한다&quot;는 보기가 나오면 틀린 것입니다. 외부 데이터도 필요에 따라 활용할 수 있습니다. 분석 과제의 주요 특징 5가지는 데이터 크기(Data Size), 데이터 복잡성(Data Complexity), 속도(Speed), 분석 복잡성(Analytic Complexity), 정확도와 정밀도(Accuracy &amp; Precision)입니다. 정확도는 모델의 예측값과 실제값의 차이가 작을수록 높은 것이…</description>
      <content:encoded><![CDATA[<p>분석 프로젝트는 비즈니스 영역과 데이터 영역의 현황을 파악하고 구성원과 협업하여 진행합니다. 주로 애자일(Agile) 방식으로 관리하며, 분석 과제 정의서를 기반으로 프로젝트를 수행합니다. 분석 과제 정의서에는 분석에 필요한 소스 데이터, 분석 방법, 데이터 입수 및 분석 난이도, 분석 수행 주기, 분석 결과에 대한 검증 방법 등이 포함됩니다. 이해관계자들이 프로젝트의 방향을 설정하고 성공 여부를 판단하기 위한 명확한 기준을 제공하는 문서입니다. 시험에서 "활용 데이터는 내부 데이터로만 제한해야 한다"는 보기가 나오면 틀린 것입니다. 외부 데이터도 필요에 따라 활용할 수 있습니다. 분석 과제의 주요 특징 5가지는 데이터 크기(Data Size), 데이터 복잡성(Data Complexity), 속도(Speed), 분석 복잡성(Analytic Complexity), 정확도와 정밀도(Accuracy &amp; Precision)입니다. 정확도는 모델의 예측값과 실제값의 차이가 작을수록 높은 것이고, 정밀도는 같은 분석을 반복했을 때 결과의 편차가 작을수록 높은 것입니다. 정확도와 정밀도 사이에는 트레이드오프(Trade-off) 관계가 존재하여, 정확도를 높이면 분석 복잡도가 상승할 수 있습니다. 핵심 요약 &amp; 시험 포인트 분석 과제 주요 특징 5가지 1. Data Size (데이터 크기) 2. Data Complexity (데이터 복잡성) 3. Speed (속도) 4. Analytic Complexity (분석 복잡성) 5. Accuracy &amp; Precision (정확도 &amp; 정밀도) 개념 정의 관점 정확도 (Accuracy) 모델 예측과 실제값의 차이가 적을수록 높음 분석의 활용 측면 정밀도 (Precision) 반복 예측 시 결과 편차가 적을수록 높음 분석의 안정성 측면 시험 포인트: 정확도와 정밀도 사이에는 Trade-off 관계가 존재합니다. 정확도↑ → 복잡도↑ (46회 출제). 분석 프로젝트 관리 방안 10가지 시간, 범위, 품질, 통합, 이해관계자, 자원, 원가, 리스크, 조달, 의사소통 프로젝트 관리 표준 - WBS(Work Breakdown Structure): 작업을 단계적으로 분해해 관리 가능한 작업 패키지로 만든 계층 구조 - PMBOK(Project Management Body of Knowledge): PMI가 정의한 프로젝트 관리 표준 - PMBOK 10대 지식 영역: 통합·범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자 관리 - 범위 관리(Scope Management): 프로젝트에 포함/제외할 작업 정의·통제 - 일정 관리(Schedule Management): WBS·간트차트·CPM(임계경로법) - 리스크 관리: 식별 → 분석 → 대응 계획 → 모니터링 위험 관리 - 위험 관리(Risk Management) 4단계: 식별(Identification) → 분석(Analysis) → 대응(Response) → 모니터링(Monitoring) - 대응 전략: 회피·완화·이전(보험)·수용 - 리스크 매트릭스: 발생 가능성 × 영향도 — 우선순위 결정 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - WBS — 작업을 단계적으로 분해해 관리 가능한 작업 패키지로 만든 계층 구조 - PMBOK 10대 지식 영역 — 통합·범위·일정·원가·품질·자원·의사소통·리스크·조달·이해관계자 관리 - 범위 관리 — 프로젝트에 포함/제외할 작업 정의·통제 - 리스크 관리 — 식별 → 분석 → 대응 계획 → 모니터링 - 위험 관리 — 4단계: 식별(Identification) → 분석(Analysis) → 대응(Response) → 모니터링(Monitorin… - 리스크 매트릭스 — 발생 가능성 × 영향도 — 우선순위 결정 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분석 마스터플랜과 우선순위 평가</title>
      <link>https://adsp.todaycode.kr/study/19</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/19</guid>
      <pubDate>Wed, 30 Sep 2026 16:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>빅데이터 3V/5V</category>
      <category>하향식·상향식 접근</category>
      <category>분석 마스터플랜</category>
      <category>우선순위 평가</category>
      <category>변수 선택</category>
      <category>분석 로드맵</category>
      <description>분석 마스터플랜은 데이터 분석 과제를 전사적 관점에서 체계적으로 수행하기 위한 중장기 계획입니다. 수립 절차는 분석 과제 도출→과제 우선순위 결정→적용 우선순위 결정→분석 구현 로드맵 수립 순서로 진행됩니다. 로드맵이란 목표 달성을 위한 방향과 일정을 시각적으로 표현한 문서입니다. 우선순위 평가 기준은 시급성과 난이도라는 두 축으로 구성됩니다. 시급성은 전략적 중요도와 비즈니스 효과(Return)를 기준으로 판단하며, 현재 시급한 과제일수록 높은 순위를 받습니다. 난이도는 데이터 획득·저장·가공 비용과 분석 적용 비용 등의 투자 비용(Investment)을 기준으로 판단합니다. 이 두 축으로 과제를 4개 영역으로 나누면, 난이도가 낮고 시급성이 높은 과제(Quick-Win)가 항상 최우선 순위입니다. 이 과제들은 적은 투자로 빠른 효과를 얻을 수 있기 때문입니다. 시급성을 우선하는 경우와 난이도를 우선하는 경우에 따라 23순위가 달라지지만, 최우선 과제는 항상 동일합니다. 또한 난이…</description>
      <content:encoded><![CDATA[<p>분석 마스터플랜은 데이터 분석 과제를 전사적 관점에서 체계적으로 수행하기 위한 중장기 계획입니다. 수립 절차는 분석 과제 도출→과제 우선순위 결정→적용 우선순위 결정→분석 구현 로드맵 수립 순서로 진행됩니다. 로드맵이란 목표 달성을 위한 방향과 일정을 시각적으로 표현한 문서입니다. 우선순위 평가 기준은 시급성과 난이도라는 두 축으로 구성됩니다. 시급성은 전략적 중요도와 비즈니스 효과(Return)를 기준으로 판단하며, 현재 시급한 과제일수록 높은 순위를 받습니다. 난이도는 데이터 획득·저장·가공 비용과 분석 적용 비용 등의 투자 비용(Investment)을 기준으로 판단합니다. 이 두 축으로 과제를 4개 영역으로 나누면, 난이도가 낮고 시급성이 높은 과제(Quick-Win)가 항상 최우선 순위입니다. 이 과제들은 적은 투자로 빠른 효과를 얻을 수 있기 때문입니다. 시급성을 우선하는 경우와 난이도를 우선하는 경우에 따라 23순위가 달라지지만, 최우선 과제는 항상 동일합니다. 또한 난이도가 높지만 시급성도 높은 과제는 경영진의 의사결정에 따라 우선순위가 조정될 수 있습니다. ISP(Information Strategy Planning, 정보전략계획)는 전략적 주요 정보를 대상으로 전사적인 종합 추진 계획을 수립하는 것으로, 중장기 마스터플랜 수립과 관련됩니다. 핵심 요약 &amp; 시험 포인트 수립 절차 우선순위 평가 기준 축 기준 관련 요소 시급성 (Y축) 전략적 중요도, 목표 가치 비즈니스 효과 (Return) = Value 난이도 (X축) 데이터 획득·저장·가공 비용 투자 비용 (Investment) = Volume, Variety, Velocity 우선순위 매트릭스 난이도 어려움 난이도 쉬움 시급성 현재 영역 ① 영역 ③ (최우선) 시급성 미래 영역 ② 영역 ④ - 시급성 우선: ③ → ④ → ② - 난이도 우선: ③ → ① → ② - 영역 ①도 경영진 의사결정에 따라 우선순위 조정 가능 시험 포인트: 난이도 낮고 시급성 높은 과제(영역 ③)가 항상 최우선입니다 (44, 46회 출제). Quick-Win 과제에 해당합니다. ISP (Information Strategy Planning, 정보전략계획) 중장기 정보화 추진 계획을 수립하는 절차로, 분석 마스터플랜의 토대가 됩니다. 단계 활동 환경 분석 비즈니스 환경, IT 트렌드, 경쟁사 분석 현황 분석 현재 데이터·시스템·역량 진단 목표 모델 수립 To-Be 아키텍처, 분석 과제 정의 이행 계획 우선순위, 일정, 예산, 조직 설계 분석 과제 우선순위 — 시급성 × 난이도 난이도 낮음 난이도 높음 -- 시급성 높음 ✅ 1순위 2순위 시급성 낮음 3순위 ❌ 4순위 - Quick Win: 시급성 높음 + 난이도 낮음 → 즉시 시작 - Long-term: 시급성 낮음 + 난이도 높음 → 단계적 추진 분석 과제 유형 (4가지 + α) - 개선과제: 기존 프로세스 효율화 - 혁신과제: 새로운 비즈니스 모델 창출 - 유지과제: 현 수준 유지를 위한 분석 - 측정과제: KPI 모니터링 시험 포인트: ISP는 정보화 전략 계획, 마스터플랜은 분석 과제의 실행 로드맵. 우선순위는 시급성×난이도 매트릭스. 투자 평가 지표 - NPV(Net Present Value, 순현재가치): 미래 현금흐름을 할인율로 현재가치 환산 후 합산. 0이면 투자 가치 있음 - IRR(Internal Rate of Return, 내부수익률): NPV = 0이 되는 할인율. 자본비용보다 크면 투자 - ROI(Return on Investment, 투자수익률): (이익 − 투자) / 투자 × 100 - TCO(Total Cost of Ownership, 총소유비용): 도입·운영·폐기까지의 전체 비용 - 비즈니스 성과(Business Outcome): 분석이 가져오는 매출 증대·비용 절감·고객 만족 등 정량/정성 결과 이행 로드맵·변화관리 - 이행계획(Implementation Plan) / 이행 로드맵: 분석 과제를 시간 축에 배치한 실행 계획 (단기·중기·장기) - 단기 마스터플랜: 1년 이내 Quick Win …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터 분석 수준 진단 — 준비도와 성숙도</title>
      <link>https://adsp.todaycode.kr/study/20</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/20</guid>
      <pubDate>Wed, 30 Sep 2026 15:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>빅데이터</category>
      <category>분석 주제 유형</category>
      <category>분석 성숙도</category>
      <category>데이터 마트</category>
      <category>OLAP</category>
      <category>데이터 기반 의사결정</category>
      <category>데이터 웨어하우스</category>
      <category>MLOps·최신 ML</category>
      <description>조직이 데이터 분석을 도입하기 전에 현재 수준을 진단하는 것이 중요합니다. 진단은 분석 준비도(Readiness)와 분석 성숙도(Maturity) 두 가지 관점에서 이루어집니다. 분석 준비도는 조직이 데이터 분석을 시작할 준비가 되어 있는지를 6가지 영역으로 평가합니다. 분석 업무(현재 수행 중인 분석 업무의 수준), 인력 및 조직(분석 전문가와 조직의 역량), 분석 기법(사용 중인 분석 기법의 적절성), 분석 데이터(데이터 관리 수준과 외부 데이터 활용도), 분석 문화(데이터 기반 의사결정 문화의 정착도), IT 인프라(분석 환경과 시스템 통합 수준)가 그것입니다. 시험에서 &quot;비용 및 예산&quot; 또는 &quot;재무 상태&quot;를 준비도 평가 요소로 제시하면 틀린 보기입니다. 분석 성숙도는 CMMI(Capability Maturity Model Integration) 모델을 기반으로 도입→활용→확산→최적화의 4단계로 평가합니다. 도입 단계에서는 분석 환경과 시스템을 구축(DW, ETL, OLAP 등…</description>
      <content:encoded><![CDATA[<p>조직이 데이터 분석을 도입하기 전에 현재 수준을 진단하는 것이 중요합니다. 진단은 분석 준비도(Readiness)와 분석 성숙도(Maturity) 두 가지 관점에서 이루어집니다. 분석 준비도는 조직이 데이터 분석을 시작할 준비가 되어 있는지를 6가지 영역으로 평가합니다. 분석 업무(현재 수행 중인 분석 업무의 수준), 인력 및 조직(분석 전문가와 조직의 역량), 분석 기법(사용 중인 분석 기법의 적절성), 분석 데이터(데이터 관리 수준과 외부 데이터 활용도), 분석 문화(데이터 기반 의사결정 문화의 정착도), IT 인프라(분석 환경과 시스템 통합 수준)가 그것입니다. 시험에서 "비용 및 예산" 또는 "재무 상태"를 준비도 평가 요소로 제시하면 틀린 보기입니다. 분석 성숙도는 CMMI(Capability Maturity Model Integration) 모델을 기반으로 도입→활용→확산→최적화의 4단계로 평가합니다. 도입 단계에서는 분석 환경과 시스템을 구축(DW, ETL, OLAP 등)하고 실적 분석 및 통계를 작성합니다. 활용 단계에서는 분석 결과를 실제 업무에 적용하고 실시간 대시보드를 활용합니다. 확산 단계에서는 전사 차원에서 분석을 관리·공유하며 비주얼 분석과 분석 전용 서버를 도입합니다. 최적화 단계에서는 분석이 조직의 혁신과 성과 향상에 직접 기여하며, 분석 Sandbox와 프로세스 내재화, 빅데이터 분석을 실행합니다. 준비도와 성숙도를 조합한 2×2 매트릭스로 조직 유형을 분류할 수 있습니다. 준비형(둘 다 낮음)은 사전 준비가 필요한 상태, 도입형(준비도 높음/성숙도 낮음)은 분석 기법은 부족하지만 조직과 인력이 준비된 상태, 정착형(준비도 낮음/성숙도 높음)은 내부에서 제한적으로 분석을 활용하는 상태, 확산형(둘 다 높음)은 6가지 구성요소를 모두 갖추어 지속적으로 확산 가능한 상태입니다. 핵심 요약 &amp; 시험 포인트 1) 데이터 분석 준비도 (Readiness) — 6가지 영역 영역 핵심 내용 분석 업무 사실 분석, 예측, 시뮬레이션, 최적화, 정기적 개선 인력 및 조직 분석 전문가, 관리자 능력, 분석 조직, 경영진 이해 분석 기법 적절한 기법, 기법 라이브러리, 평가, 정기적 개선 분석 데이터 데이터 관리, 외부 데이터 활용, MDM(기준 데이터 관리) 분석 문화 사실 기반 의사결정, 데이터 공유·협업 IT 인프라 운영 시스템 데이터 통합, 분석 환경 시험 포인트: "비용 및 예산", "재무 상태"는 준비도 평가 요소가 아닙니다 (46, 47회 출제). 2) 데이터 분석 성숙도 (Maturity) — CMMI 모델 기반 단계 내용 도입 시스템 구축, DW/ETL/OLAP, 실적 분석 및 통계 작성 활용 분석 결과 업무 적용, 실시간 대시보드 확산 전사 차원 분석 관리·공유, 비주얼 분석, 분석 전용 서버 최적화 혁신·성과 향상, 분석 Sandbox, 프로세스 내재화, 빅데이터 시험 포인트: 도입 단계 = 실적 분석 및 통계 작성 (44회 출제) CMMI 단계 혼동 주의: - 도입 ≠ 경영진 활용 시작 (도입 = 실적 분석·통계 작성) - 활용 = 업무 적용·실시간 대시보드 (실적 분석이 아님) - 확산 = 전사 공유·비주얼 분석 (프로세스 내재화가 아님) - 최적화 = Sandbox·프로세스 내재화·빅데이터 (46, 47회 출제) 분석 성숙도 모델 4단계 단계 명칭 주요 활동 1 도입(Introduction) 분석 환경/시스템 구축, 일부 부서 시범 2 활용(Activation) 업무에 분석 본격 적용, 효과 측정 3 확산(Diffusion) 전사 확산, 분석 문화 정착, 성과 공유 4 최적화(Optimization) 분석 진화, 혁신 사례, 사업 모델 변화 분석 준비도 × 성숙도 매트릭스 (4사분면) 성숙도 낮음 성숙도 높음 -- 준비도 높음 준비형 (도입 직전) 정착형 (목표 달성) 준비도 낮음 도입형 (초기 단계) 확산형 (실행 활발) 분석 준비도 6대 영역 1. 분석 업무: 분석 적용 업무 범위 2. 분석 인력 및 조직: 전문 인력, 조직 체계 3. 분석 기법: 활용 알고리즘 다양성 4. …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터 거버넌스와 분석 거버넌스</title>
      <link>https://adsp.todaycode.kr/study/21</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/21</guid>
      <pubDate>Wed, 30 Sep 2026 14:29:04 GMT</pubDate>
      <category>2과목 데이터 분석 기획</category>
      <category>분석 방법론</category>
      <category>우선순위 평가</category>
      <category>데이터 거버넌스</category>
      <category>기술통계</category>
      <category>데이터 전처리</category>
      <category>MLOps·최신 ML</category>
      <description>데이터 거버넌스는 전사 차원의 데이터 관리 체계를 구축하는 것입니다. 구성요소는 원칙, 조직, 프로세스 세 가지이며, 관리 대상은 마스터 데이터(핵심 기준 데이터), 메타 데이터(데이터에 대한 데이터), 데이터 사전(데이터의 정의와 규칙을 정리한 문서)입니다. 데이터 표준 용어 설정과 명명 규칙 수립 등 표준화 작업이 포함됩니다. 시험에서 &quot;데이터 거버넌스는 전담 조직에서 독립적으로 운영되어야 한다&quot;는 보기가 나오면 틀린 것입니다. 데이터 거버넌스는 전사 차원의 협업이 필요하며, 특정 부서만의 독립적 운영으로는 효과를 얻기 어렵습니다. 분석 거버넌스는 데이터 분석과 활용을 위한 의사결정 관리 체계입니다. 구성요소는 프로세스(Process), 조직(Organization), 시스템(System), 인적자원(Human Resource), 데이터(Data)의 다섯 가지입니다. 여기서 &quot;분석 기법(Technology)&quot;은 분석 거버넌스의 구성요소에 포함되지 않으므로 주의해야 합니다. 분석 …</description>
      <content:encoded><![CDATA[<p>데이터 거버넌스는 전사 차원의 데이터 관리 체계를 구축하는 것입니다. 구성요소는 원칙, 조직, 프로세스 세 가지이며, 관리 대상은 마스터 데이터(핵심 기준 데이터), 메타 데이터(데이터에 대한 데이터), 데이터 사전(데이터의 정의와 규칙을 정리한 문서)입니다. 데이터 표준 용어 설정과 명명 규칙 수립 등 표준화 작업이 포함됩니다. 시험에서 "데이터 거버넌스는 전담 조직에서 독립적으로 운영되어야 한다"는 보기가 나오면 틀린 것입니다. 데이터 거버넌스는 전사 차원의 협업이 필요하며, 특정 부서만의 독립적 운영으로는 효과를 얻기 어렵습니다. 분석 거버넌스는 데이터 분석과 활용을 위한 의사결정 관리 체계입니다. 구성요소는 프로세스(Process), 조직(Organization), 시스템(System), 인적자원(Human Resource), 데이터(Data)의 다섯 가지입니다. 여기서 "분석 기법(Technology)"은 분석 거버넌스의 구성요소에 포함되지 않으므로 주의해야 합니다. 분석 조직 유형은 세 가지로 나뉩니다. 집중형 조직은 별도의 전담 조직에서 회사 차원의 우선순위에 따라 분석 업무를 일괄적으로 수행합니다. 기능형 조직은 별도의 분석 조직 없이 각 업무 부서에서 분석을 수행하므로 전사 관점의 핵심 분석이 어렵습니다. 분산형 조직은 분석 인력을 현업 부서에 직접 배치해 전사 차원의 우선순위로 분석을 수행하며, 실무 대응이 빠릅니다. 제3과목 — 데이터 분석 핵심 요약 &amp; 시험 포인트 전사 차원의 데이터 관리 체계를 구축하는 것입니다. 항목 내용 구성요소 원칙, 조직, 프로세스 관리 대상 마스터 데이터, 메타 데이터, 데이터 사전 시험 포인트: "데이터 거버넌스는 전담 조직에서 독립적으로 운영"은 틀린 설명입니다 (47회 출제). 전사 차원의 협업이 필요합니다. 데이터 거버넌스 vs 분석 거버넌스 비교 항목 데이터 거버넌스 분석 거버넌스 목적 전사 데이터 관리 체계 구축 데이터 분석·활용 의사결정 관리 체계 구성요소 원칙, 조직, 프로세스 (3가지) 프로세스, 조직, 시스템, 인적자원, 데이터 (5가지) 관리 대상 마스터 데이터, 메타 데이터, 데이터 사전 분석 과제, 분석 조직, 분석 프로세스 포함 안 되는 것 - 분석 기법(Technology)은 구성요소 아님 시험 포인트: 분석 거버넌스 구성요소는 5가지(프·조·시·인·데). "분석 기법(Technology)"은 포함되지 않습니다 (Q42 빈출). 데이터 분석 조직 구조 3가지 구조 형태 장점 단점 집중형(Centralized) 전사 단일 분석 조직 일관성·전문성, 표준화 현업과 거리, 우선순위 충돌 기능형(Functional) 각 부서 내 분석 인력 분산 현업 밀착, 빠른 의사결정 사일로화, 중복 작업 분산형(Distributed) 분석 전문가가 부서 파견 (CoE 모델) 전문성 + 현업 결합 관리·보고 라인 복잡 CoE (Center of Excellence) - 분산형의 대표 모델: 중앙 분석 센터에서 인력을 부서로 파견 - 표준 방법론 + 현업 적용성 동시 확보 - 분석 거버넌스의 모범 사례로 자주 출제 시험 포인트: 3가지 조직 구조의 장단점 매칭과 CoE의 의미가 자주 출제됨. 추가 핵심 개념 — 거버넌스 운영 인프라 - 데이터 카탈로그(Data Catalog): 조직 내 데이터 자산을 목록화해 검색·발견을 지원하는 시스템. 메타데이터 + 비즈니스 용어집 + 데이터 오너십 + 사용 통계 포함. 도구: Apache Atlas·AWS Glue·Alation·Collibra·DataHub. - 데이터 사전(Data Dictionary): 데이터베이스 내 테이블·컬럼의 정의·타입·제약조건을 정의한 문서. 데이터 카탈로그의 하위 개념. - 데이터 리니지(Data Lineage): 데이터의 출처(Source) → 변환 → 활용까지 전체 흐름을 추적하는 기능. 데이터 품질·신뢰성 보장의 핵심. - 마스터 데이터 관리(MDM, Master Data Management): 고객·상품·조직 등 핵심 참조 데이터의 표준화·중복 제거·일관성 유지. - 데이터 거버넌스 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>통계의 기초 — 척도와 기술통계</title>
      <link>https://adsp.todaycode.kr/study/22</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/22</guid>
      <pubDate>Wed, 30 Sep 2026 13:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>척도</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>이상치·결측</category>
      <category>점추정·구간추정</category>
      <description>통계 분석의 첫걸음은 데이터를 측정하는 척도의 종류를 이해하는 것입니다. 척도는 네 가지 수준으로 나뉘며, 각 수준에 따라 적용할 수 있는 분석 방법이 달라집니다. 명목척도는 단순히 범주를 구분하기 위한 것으로, 숫자에 수학적 의미가 없습니다. 성별(남/여), 혈액형(A/B/O/AB), 거주지역(수도권/비수도권) 등이 해당됩니다. 서열척도는 범주 간에 순서(서열)가 있지만 간격이 동일하지는 않습니다. 학년(1학년&lt;2학년&lt;3학년), 만족도 등급(매우불만&lt;불만&lt;보통&lt;만족&lt;매우만족)이 예입니다. 등간척도는 범주 간 간격이 동일하지만 절대적 영점(0)이 없는 척도입니다. 온도(섭씨 0도가 &quot;온도가 없다&quot;를 뜻하지 않음), 시험 점수가 해당됩니다. 비율척도는 절대적 영점(0)이 존재하여 비율 계산이 가능한 척도입니다. 키, 몸무게, 나이, 소득 등이 해당되며 &quot;몸무게 0kg은 무게가 없다&quot;를 의미합니다. 기술통계는 수집된 데이터를 표나 그래프, 수치 요약 등으로 정리하여 데이터의 특성을 파악…</description>
      <content:encoded><![CDATA[<p>통계 분석의 첫걸음은 데이터를 측정하는 척도의 종류를 이해하는 것입니다. 척도는 네 가지 수준으로 나뉘며, 각 수준에 따라 적용할 수 있는 분석 방법이 달라집니다. 명목척도는 단순히 범주를 구분하기 위한 것으로, 숫자에 수학적 의미가 없습니다. 성별(남/여), 혈액형(A/B/O/AB), 거주지역(수도권/비수도권) 등이 해당됩니다. 서열척도는 범주 간에 순서(서열)가 있지만 간격이 동일하지는 않습니다. 학년(1학년<2학년<3학년), 만족도 등급(매우불만<불만<보통<만족<매우만족)이 예입니다. 등간척도는 범주 간 간격이 동일하지만 절대적 영점(0)이 없는 척도입니다. 온도(섭씨 0도가 "온도가 없다"를 뜻하지 않음), 시험 점수가 해당됩니다. 비율척도는 절대적 영점(0)이 존재하여 비율 계산이 가능한 척도입니다. 키, 몸무게, 나이, 소득 등이 해당되며 "몸무게 0kg은 무게가 없다"를 의미합니다. 기술통계는 수집된 데이터를 표나 그래프, 수치 요약 등으로 정리하여 데이터의 특성을 파악하는 방법입니다. 대표값에는 평균(모든 값의 합을 개수로 나눈 것), 중앙값(데이터를 크기순으로 나열했을 때 가운데 값), 최빈값(가장 자주 나타나는 값)이 있습니다. 산포도 측정에는 분산, 표준편차, 사분위범위(IQR) 등이 사용됩니다. IQR은 제3사분위수(Q3)에서 제1사분위수(Q1)를 뺀 값으로, 데이터의 중앙 50%가 흩어진 정도를 나타냅니다. IQR은 이상치(Outlier)의 영향을 받지 않는 로버스트(Robust)한 산포 지표라는 점이 중요합니다. 상자그림(Box Plot)에서 이상치 판단 기준은 하한=Q1-1.5×IQR, 상한=Q3+1.5×IQR입니다. 정규분포는 평균을 중심으로 좌우 대칭인 종 모양의 분포로, 왜도(Skewness)=0(좌우 대칭), 첨도(Kurtosis)=3(또는 초과 첨도=0)인 특성을 가집니다. "정규분포의 왜도는 1이다"라는 보기가 나오면 0이므로 틀린 설명입니다. 평균=중앙값=최빈값이 모두 같은 것도 정규분포의 중요한 특성입니다. 반면 오른쪽(양) 꼬리 분포에서는 최빈값 < 중앙값 < 평균이고, 왼쪽(음) 꼬리 분포에서는 평균 < 중앙값 < 최빈값의 순서가 됩니다. 핵심 요약 &amp; 시험 포인트 4가지 척도 비교 척도 특징 허용 연산 예시 명목(Nominal) 분류만 가능, 순서 없음 빈도, 최빈값 혈액형, 성별 서열(Ordinal) 순서 있음, 간격 불균등 중앙값, 순위 만족도 순위, 학점 등간(Interval) 동일 간격, 절대 0 없음 평균, 표준편차 섭씨 온도, IQ 비율(Ratio) 절대 0 있음, 비율 의미 모든 연산 키·몸무게·연봉 분포의 모양과 대표값 순서 분포 순서 정규분포 평균 = 중앙값 = 최빈값 오른쪽 꼬리(양의 왜도) 최빈값 < 중앙값 < 평균 왼쪽 꼬리(음의 왜도) 평균 < 중앙값 < 최빈값 시험 포인트: 등간척도의 절대 0 예 = 섭씨 온도(0°C는 온도 없음이 아님). 비율척도의 절대 0 예 = 몸무게(0kg = 없음). 정규분포 왜도=0, 첨도=3. 모집단 vs 표본, 모수 vs 통계량 개념 모집단(Population) 표본(Sample) 정의 관심 대상 전체 모집단의 일부 (조사 대상) 측정값 모수(Parameter) 통계량(Statistic) 표기 μ(평균), σ(표준편차), p(비율) x̄, s, p̂ 성격 고정된 상수 (보통 미지수) 표본마다 변하는 확률변수 추정(Estimation)의 두 가지 방법 - 점추정(Point Estimation): 모수를 하나의 값으로 추정 (x̄으로 μ 추정) - 구간추정(Interval Estimation): 신뢰구간으로 추정 (95% CI) 좋은 추정량의 성질 성질 의미 불편성(Unbiasedness) E(추정량) = 모수 (편향이 0) 효율성(Efficiency) 분산이 가장 작은 추정량 일치성(Consistency) 표본 크기 n→∞ 일 때 모수에 수렴 충분성(Sufficiency) 모수에 대한 모든 정보를 담음 시험 포인트: 모수는 고정된 미지의 상수, 통계량(표본 통계)은 확률변수. 표본평균 x̄은 모평균 μ의 불편추정량…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>확률의 기초와 확률분포</title>
      <link>https://adsp.todaycode.kr/study/23</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/23</guid>
      <pubDate>Wed, 30 Sep 2026 12:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>확률</category>
      <category>점추정·구간추정</category>
      <description>확률이란 어떤 사건이 일어날 가능성을 0에서 1 사이의 숫자로 나타낸 것입니다. 확률이 0이면 절대 일어나지 않고, 1이면 반드시 일어나며, 0.5이면 일어날 가능성과 일어나지 않을 가능성이 같습니다. 두 사건이 독립사건(서로 영향을 주지 않음)이고, 독립일 때, 두 사건이 동시에 일어날 확률은 각 사건의 확률을 곱한 것입니다. P(A∩B)=P(A)×P(B)입니다. 시험에서 &quot;두 독립 사건의 동시 발생 확률은 두 확률의 합&quot;이라는 보기가 나오면 틀린 것입니다. 합이 아니라 곱입니다. 조건부확률은 사건 A가 일어났을 때 사건 B가 일어날 확률로 P(B A)=P(A∩B)/P(A)로 계산합니다. 베이즈 정리는 조건부확률을 이용해 사전확률로부터 사후확률을 계산하는 이론입니다. P(A B) = P(B A)×P(A)/P(B) 형태로 표현되며, 새로운 증거(B)를 관찰한 후에 기존의 믿음(사전확률 P(A))을 업데이트하여 사후확률 P(A B)를 구합니다. 예) 스팸 필터: 단어 &apos;FREE&apos;가 등…</description>
      <content:encoded><![CDATA[<p>확률이란 어떤 사건이 일어날 가능성을 0에서 1 사이의 숫자로 나타낸 것입니다. 확률이 0이면 절대 일어나지 않고, 1이면 반드시 일어나며, 0.5이면 일어날 가능성과 일어나지 않을 가능성이 같습니다. 두 사건이 독립사건(서로 영향을 주지 않음)이고, 독립일 때, 두 사건이 동시에 일어날 확률은 각 사건의 확률을 곱한 것입니다. P(A∩B)=P(A)×P(B)입니다. 시험에서 "두 독립 사건의 동시 발생 확률은 두 확률의 합"이라는 보기가 나오면 틀린 것입니다. 합이 아니라 곱입니다. 조건부확률은 사건 A가 일어났을 때 사건 B가 일어날 확률로 P(B A)=P(A∩B)/P(A)로 계산합니다. 베이즈 정리는 조건부확률을 이용해 사전확률로부터 사후확률을 계산하는 이론입니다. P(A B) = P(B A)×P(A)/P(B) 형태로 표현되며, 새로운 증거(B)를 관찰한 후에 기존의 믿음(사전확률 P(A))을 업데이트하여 사후확률 P(A B)를 구합니다. 예) 스팸 필터: 단어 'FREE'가 등장할 때 스팸일 확률을 계산하는 데 사용합니다. 기대값은 확률변수가 취할 수 있는 각 값에 해당 확률을 곱하여 모두 더한 것입니다. 예를 들어 P(X=1)=0.4, P(X=2)=0.3, P(X=3)=0.2, P(X=4)=0.1이면 E(X)=1×0.4+2×0.3+3×0.2+4×0.1=2.0입니다. 중심극한정리는 모집단의 분포가 어떤 형태이든, 표본의 크기가 충분히 크면 표본 평균의 분포가 정규분포에 가까워진다는 정리입니다. 모집단이 반드시 정규분포를 따를 필요는 없으며, 모집단의 분포가 비대칭일수록 정규분포에 가까워지기 위해 더 큰 표본 크기가 필요합니다. 일반적으로 표본 크기 n≥30이면 중심극한정리를 적용할 수 있다고 봅니다. "중심극한정리는 모집단이 정규분포를 따를 때만 성립한다"는 보기가 나오면 틀린 설명입니다. 주요 확률분포 정리 이산확률분포 분포 의미 모수 이항분포 B(n,p) n번 시행 중 성공 횟수 n, p 포아송 P(λ) 일정 시간 내 사건 발생 횟수 λ (평균=분산) 기하분포 첫 성공까지의 시행 횟수 p 음이항분포 r번째 성공까지의 시행 횟수 r, p 연속확률분포 분포 의미 특징 균등분포 U(a,b) [a,b] 사이 모든 값이 같은 확률 평균=(a+b)/2 정규분포 N(μ,σ²) 종 모양 좌우대칭 평균=중앙값=최빈값 지수분포 Exp(λ) 사건 간 시간 간격, 무기억성 평균=1/λ 카이제곱(χ²) 정규분포 제곱합 (자유도 k) 분산 추정·검정 t분포 표본이 작을 때 정규 대신 (자유도 n-1) 평균 추정 F분포 두 카이제곱의 비 ANOVA·분산 비교 시험 포인트: 포아송은 평균=분산. 지수분포는 "무기억성" (기억하지 않음). t분포는 자유도가 커지면 정규분포에 수렴. 추가 핵심 개념 — 베르누이 시행과 분포 관계 - 베르누이 시행(Bernoulli Trial): 결과가 성공(1)·실패(0)로만 나타나는 단일 시행. P(X=1) = p, P(X=0) = 1-p. 평균 = p, 분산 = p(1-p). - 이항분포 B(n, p): 베르누이 시행을 n번 반복한 성공 횟수의 분포. 평균 = np, 분산 = np(1-p). - 분포 간 근사 관계: - 이항 B(n, p): n↑·p작음(np=λ 일정) → 포아송 P(λ) 근사 (드문 사건) - 이항 B(n, p): n↑·p≈0.5 → 정규분포 N(np, np(1-p)) 근사 (CLT) - 포아송 사건 간격 → 지수분포 Exp(λ) (무기억성, Memoryless) - 백색잡음(White Noise): 평균 0·일정 분산·자기상관 0인 정상 시계열. ARIMA 잔차의 이상적 가정. 시험 핵심: 베르누이 → 이항 → 포아송 → 지수의 관계와 근사 조건이 시계열·확률에서 자주 묶여 출제됩니다. 베이지안 추론 - 베이즈 정리: P(A B) = P(B A)·P(A) / P(B) - 사전확률(Prior): 데이터 관찰 전 신념. P(A) - 우도(Likelihood): 가설이 참일 때 데이터가 관찰될 확률. P(B A) - 사후확률(Posterior): 데이터 관찰 후 갱신된 신념. P(A B…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>표본추출 방법</title>
      <link>https://adsp.todaycode.kr/study/24</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/24</guid>
      <pubDate>Wed, 30 Sep 2026 11:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>표본추출</category>
      <category>군집분석</category>
      <category>모형 평가</category>
      <category>표본조사</category>
      <description>모집단 전체를 조사하기 어려울 때 일부를 추출하여 조사하는 것이 표본조사입니다. 표본추출 방법에는 네 가지가 있습니다. 단순무작위추출법은 모집단의 모든 개체가 동일한 확률로 추출되는 가장 기본적인 방법입니다. 계통추출법(체계추출법)은 모집단에 일련번호를 부여한 후, N/n=k(추출 간격)를 계산하여 1k 중 첫 번째 표본을 무작위로 선택(r)하고, 이후 r, r+k, r+2k, ... 순으로 일정 간격으로 표본을 선택하는 방법입니다. 규칙성이 있는 모집단에 적용 시 편향이 발생할 수 있다는 단점이 있습니다. 층화추출법은 모집단을 서로 중복되지 않는 여러 그룹(층, strata)으로 나눈 다음, 각 층에서 무작위로 표본을 추출하는 방법입니다. 모집단의 특성을 잘 반영할 수 있다는 장점이 있습니다. 집락추출법(군집추출법)은 모집단을 여러 집단(군집)으로 나눈 후 일부 군집을 먼저 선택하고, 선택된 군집 내에서 표본을 추출하는 다단계 방법입니다. 표본조사에서 발생하는 오차는 표본오차와 비…</description>
      <content:encoded><![CDATA[<p>모집단 전체를 조사하기 어려울 때 일부를 추출하여 조사하는 것이 표본조사입니다. 표본추출 방법에는 네 가지가 있습니다. 단순무작위추출법은 모집단의 모든 개체가 동일한 확률로 추출되는 가장 기본적인 방법입니다. 계통추출법(체계추출법)은 모집단에 일련번호를 부여한 후, N/n=k(추출 간격)를 계산하여 1k 중 첫 번째 표본을 무작위로 선택(r)하고, 이후 r, r+k, r+2k, ... 순으로 일정 간격으로 표본을 선택하는 방법입니다. 규칙성이 있는 모집단에 적용 시 편향이 발생할 수 있다는 단점이 있습니다. 층화추출법은 모집단을 서로 중복되지 않는 여러 그룹(층, strata)으로 나눈 다음, 각 층에서 무작위로 표본을 추출하는 방법입니다. 모집단의 특성을 잘 반영할 수 있다는 장점이 있습니다. 집락추출법(군집추출법)은 모집단을 여러 집단(군집)으로 나눈 후 일부 군집을 먼저 선택하고, 선택된 군집 내에서 표본을 추출하는 다단계 방법입니다. 표본조사에서 발생하는 오차는 표본오차와 비표본오차로 나뉩니다. 표본오차는 표본이 모집단을 완벽히 대표하지 못해서 생기는 오차이며, 표본 크기가 커질수록 줄어듭니다. 비표본오차는 측정 실수, 응답 거부, 잘못된 질문 설계 등 표본 추출 방법과 무관하게 발생하는 오차입니다. "표본추출을 통해 비표본오차를 최소화할 수 있다"는 설명은 틀린 것입니다. 핵심 요약 &amp; 시험 포인트 4가지 표본추출 방법 방법 절차 특징 단순무작위추출 모든 개체 동일 확률 가장 기본, 전제 조건 계통추출(체계추출) 간격 k=N/n으로 일정 추출 주기적 패턴 있으면 편향 발생 위험 층화추출 층(strata) 구분 후 각 층에서 무작위 모집단 특성 잘 반영 집락추출(군집추출) 군집 선택 후 내부 추출 비용 절감, 다단계 추출 오차 구분 오차 의미 줄이는 방법 표본오차 표본이 모집단을 완벽 대표 못해 발생 표본 크기 증가 비표본오차 측정 실수·응답 거부·설계 오류 등 표본추출로 해결 불가 시험 포인트: 계통추출법은 주기적 패턴 모집단에서 편향 위험. "비표본오차는 표본추출로 최소화"는 틀린 설명. 집략→집락추출법이 정확한 표기. 확률 표본추출 4가지 방법 (필수 암기) 방법 절차 장단점 단순랜덤추출 (Simple Random Sampling) 모집단에서 무작위 n개 추출 단순/공정, 모집단 정보 필요 계통추출 (Systematic Sampling) k번째마다 추출 (k = N/n) 간편, 주기성 있으면 편향 층화추출 (Stratified Sampling) 모집단을 동질 층(Stratum)으로 나누고 비율대로 추출 정밀도↑, 층 정의 필요 집락추출 (Cluster Sampling) 모집단을 집락(Cluster)으로 나눠 일부 집락 전체 조사 비용↓, 정확도↓ 층화 vs 집락 비교 (시험 단골) 구분 층화추출 집락추출 그룹 내 동질성 높음 (비슷한 것끼리) 낮음 (전체 모집단 축소판) 그룹 간 동질성 낮음 (층끼리 다름) 높음 표본 추출 모든 층에서 추출 일부 집락만 선택 비확률 표본추출 - 편의추출: 접근하기 쉬운 대상 (표본 편향 위험) - 할당추출: 특정 비율로 미리 할당 (조사원 판단) - 눈덩이추출: 응답자가 다른 응답자 소개 (희귀 모집단) 시험 포인트: 층화는 "층 내 동질·층 간 이질", 집락은 그 반대. 계통추출은 주기성에 주의. 추가 핵심 개념 — 중심극한정리와 복원/비복원 추출 - 중심극한정리(CLT, Central Limit Theorem): 표본 크기 n이 충분히 크면(보통 n ≥ 30) 모집단 분포 형태와 무관하게 표본평균 X̄의 분포가 정규분포 N(μ, σ²/n)에 근사. 표준오차 SE = σ/√n. - 복원추출(Sampling with Replacement): 추출한 표본을 모집단에 되돌려놓고 다시 추출. 같은 개체가 여러 번 선택 가능. 부트스트랩(Bootstrap)·배깅의 기반. - 비복원추출(Sampling without Replacement): 한 번 추출된 개체는 다시 뽑지 않음. 모집단이 충분히 클 때는 복원추출과 거의 같은 결과. - 부트스트랩(Bootstrap): 원본 데이…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>가설검정과 유의성 판단</title>
      <link>https://adsp.todaycode.kr/study/25</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/25</guid>
      <pubDate>Wed, 30 Sep 2026 10:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>빅데이터 3V/5V</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>가설검정</category>
      <category>비모수 검정</category>
      <category>점추정·구간추정</category>
      <category>t검정</category>
      <description>가설검정은 데이터를 이용하여 어떤 주장(가설)이 타당한지를 통계적으로 판단하는 절차입니다. 검정에는 두 가지 가설을 세웁니다. 귀무가설(H₀)은 &quot;효과가 없다&quot; 또는 &quot;차이가 없다&quot;는 현재 상태를 지지하는 가설이고, 대립가설(H₁)은 &quot;효과가 있다&quot; 또는 &quot;차이가 있다&quot;는 새로운 주장입니다. p-value(유의확률)는 귀무가설이 참이라고 가정했을 때, 현재 관측된 결과 이상으로 극단적인 결과가 나올 확률입니다. p-value가 작을수록 귀무가설이 참일 가능성이 낮으므로, 대립가설을 지지하는 증거가 됩니다. p-value가 유의수준(α, 보통 0.05)보다 작으면 귀무가설을 기각하고 대립가설을 채택합니다. 시험에서 &quot;p-value가 유의수준보다 작으면 대립가설을 기각한다&quot;는 보기가 나오면 반대이므로 틀린 것입니다. 제1종 오류(α 오류)는 귀무가설이 실제로 참인데도 기각하는 오류입니다. 즉 효과가 없는데 있다고 잘못 판단하는 것입니다. 유의수준(α)은 이 오류의 최대 허용 한계입니다.…</description>
      <content:encoded><![CDATA[<p>가설검정은 데이터를 이용하여 어떤 주장(가설)이 타당한지를 통계적으로 판단하는 절차입니다. 검정에는 두 가지 가설을 세웁니다. 귀무가설(H₀)은 "효과가 없다" 또는 "차이가 없다"는 현재 상태를 지지하는 가설이고, 대립가설(H₁)은 "효과가 있다" 또는 "차이가 있다"는 새로운 주장입니다. p-value(유의확률)는 귀무가설이 참이라고 가정했을 때, 현재 관측된 결과 이상으로 극단적인 결과가 나올 확률입니다. p-value가 작을수록 귀무가설이 참일 가능성이 낮으므로, 대립가설을 지지하는 증거가 됩니다. p-value가 유의수준(α, 보통 0.05)보다 작으면 귀무가설을 기각하고 대립가설을 채택합니다. 시험에서 "p-value가 유의수준보다 작으면 대립가설을 기각한다"는 보기가 나오면 반대이므로 틀린 것입니다. 제1종 오류(α 오류)는 귀무가설이 실제로 참인데도 기각하는 오류입니다. 즉 효과가 없는데 있다고 잘못 판단하는 것입니다. 유의수준(α)은 이 오류의 최대 허용 한계입니다. 시험에서 "유의수준은 제1종 오류의 최소 허용 한계"라고 하면 틀린 것입니다. 최소가 아니라 최대입니다. 제2종 오류(β 오류)는 대립가설이 실제로 참인데 귀무가설을 기각하지 못하는 오류입니다. 유의수준을 너무 작게 설정하면 제2종 오류를 범할 확률이 높아지는 트레이드오프 관계가 있습니다. 검정력(Power) = 1 - β로, 대립가설이 참일 때 귀무가설을 올바르게 기각하는 확률입니다. 검정력이 높을수록 실제 효과를 놓치지 않고 잡아낼 수 있으며, 표본 크기가 클수록 검정력이 높아집니다. 비모수 검정은 데이터가 특정 분포를 따른다는 가정 없이 수행하는 검정으로, 윌콕슨 순위합 검정, 만-휘트니 검정, run 검정 등이 있습니다. t-검정은 정규분포를 가정하는 모수 검정이므로 비모수 검정에 해당하지 않습니다. 신뢰구간(Confidence Interval)은 모수를 특정 확률로 포함하는 구간을 추정하는 방법입니다. 95% 신뢰구간이란 "동일한 방법으로 표본 추출을 100번 반복하면 그 중 약 95번은 모수를 포함하는 구간이 만들어진다"는 의미입니다. "모수가 95% 확률로 신뢰구간 안에 있다"는 표현은 엄밀하게 틀린 해석입니다. 신뢰수준을 높이면 신뢰구간의 폭이 넓어지고, 표본 크기를 늘리면 신뢰구간의 폭이 좁아집니다. 분산분석(ANOVA, Analysis of Variance) 3개 이상 집단의 평균 차이를 검정하는 방법입니다. t-검정은 두 집단만 비교 가능하지만 ANOVA는 다집단 비교가 가능합니다. 종류 요인 수 예시 일원분산분석(One-way) 1개 학원별 점수 차이 이원분산분석(Two-way) 2개 학원×성별 점수 차이 반복측정 ANOVA 동일 대상 반복 약물 투여 전후 F 통계량 F = 집단 간 분산(MSB) / 집단 내 분산(MSW) - F가 클수록 집단 간 차이가 큼 → 귀무가설(평균 동일) 기각 - 귀무가설 H₀: μ₁ = μ₂ = ... = μk - 대립가설 H₁: 적어도 하나의 평균은 다름 사후검정(Post-hoc Test) ANOVA로 "차이가 있다"는 결론이 나면, 어느 집단끼리 다른지 추가 검정. - Tukey HSD: 가장 일반적, 모든 쌍을 비교 - Bonferroni: 다중비교 보정, 보수적 - Scheffé: 가장 보수적 카이제곱 검정(Chi-Square Test) 범주형 변수의 빈도 분석에 사용하는 비모수 검정입니다. 종류 용도 적합도 검정 관측 빈도가 기대 분포에 맞는가? (예: 주사위 공정성) 독립성 검정 두 범주형 변수가 독립인가? (예: 성별과 흡연) 동질성 검정 여러 모집단의 분포가 같은가? (예: 지역별 선호도) χ² 통계량 χ² = Σ (관측빈도 - 기대빈도)² / 기대빈도 - 분할표(Contingency Table) 기반 - 자유도: (행수-1) × (열수-1) - p-value < α → 독립이 아님(연관 있음) 시험 포인트: 3개 이상 집단 평균 비교 = ANOVA. 두 범주형 변수 연관성 = 카이제곱 독립성 검정. t-검정의 3가지 종류 종류 비교 대상 가정 예시 단일표본 t검정 한 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>상관분석</title>
      <link>https://adsp.todaycode.kr/study/26</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/26</guid>
      <pubDate>Wed, 30 Sep 2026 09:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>척도</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>상관분석</category>
      <category>회귀분석</category>
      <category>R 프로그래밍</category>
      <category>비모수 검정</category>
      <category>이상치·결측</category>
      <category>데이터 기반 의사결정</category>
      <category>점추정·구간추정</category>
      <description>상관분석은 두 변수 사이의 직선적 관계의 강도와 방향을 측정하는 분석입니다. 상관계수는 -1에서 1 사이의 값을 가지며, 1에 가까울수록 강한 양의 상관관계(한 변수가 증가하면 다른 변수도 증가), -1에 가까울수록 강한 음의 상관관계(한 변수가 증가하면 다른 변수는 감소), 0이면 직선적 상관관계가 없음을 의미합니다. 시험에서 &quot;상관계수가 -1이면 상관관계가 가장 약하다&quot;는 보기가 나오면 틀린 것입니다. -1은 완전한 음의 상관관계이므로 가장 강한 관계입니다. 아래 산점도 모음(위키미디어 Correlationexamples2)을 보면 세 줄로 상관계수의 본질을 한눈에 정리할 수 있습니다. 1행은 r이 +1, 0.8, 0.4, 0, -0.4, -0.8, -1로 변하며 직선 관계의 강도와 방향이 어떻게 달라지는지를 보여 줍니다. 2행은 모든 그림의 r이 0에 가깝지만 점들의 분산만 다른 형태로, 분산이 크다고 해서 상관이 약해지는 것이 아니라는 점을 알려 줍니다. 3행은 곡선·V자·U…</description>
      <content:encoded><![CDATA[<p>상관분석은 두 변수 사이의 직선적 관계의 강도와 방향을 측정하는 분석입니다. 상관계수는 -1에서 1 사이의 값을 가지며, 1에 가까울수록 강한 양의 상관관계(한 변수가 증가하면 다른 변수도 증가), -1에 가까울수록 강한 음의 상관관계(한 변수가 증가하면 다른 변수는 감소), 0이면 직선적 상관관계가 없음을 의미합니다. 시험에서 "상관계수가 -1이면 상관관계가 가장 약하다"는 보기가 나오면 틀린 것입니다. -1은 완전한 음의 상관관계이므로 가장 강한 관계입니다. 아래 산점도 모음(위키미디어 Correlationexamples2)을 보면 세 줄로 상관계수의 본질을 한눈에 정리할 수 있습니다. 1행은 r이 +1, 0.8, 0.4, 0, -0.4, -0.8, -1로 변하며 직선 관계의 강도와 방향이 어떻게 달라지는지를 보여 줍니다. 2행은 모든 그림의 r이 0에 가깝지만 점들의 분산만 다른 형태로, 분산이 크다고 해서 상관이 약해지는 것이 아니라는 점을 알려 줍니다. 3행은 곡선·V자·U자처럼 명확한 비선형 패턴이 존재하지만 피어슨 r이 0인 사례입니다. "r=0이면 두 변수 사이에 아무 관계가 없다"는 보기가 시험에 자주 등장하는데, 이는 선형 관계만 없을 뿐 비선형 관계는 있을 수 있으므로 틀린 설명입니다. 피어슨 상관계수는 연속형 변수 간의 선형 관계를 측정할 때 사용합니다. 두 변수가 모두 정규분포를 따르고 선형 관계일 때 가장 적합합니다. 스피어만 상관계수는 서열형(순위형) 변수 간의 관계를 분석할 때 사용하며, 비선형 관계도 어느 정도 파악할 수 있습니다. 시험에서 "스피어만은 범주형 변수의 선형 관계를 설명한다"는 보기가 나오면, 스피어만은 서열형 변수에 사용하고 비선형 관계도 분석 가능하므로 틀린 설명입니다. 또한 명목척도는 순서가 없으므로 스피어만 분석으로 분석할 수 없습니다. 상관분석에서 주의할 점은 상관관계가 인과관계를 의미하지 않는다는 것입니다. 또한 켄달의 타우(Kendall's τ)도 서열형 변수에 적합한 비모수 상관계수로, 스피어만 상관계수와 유사하나 일치쌍과 불일치쌍의 비율로 계산합니다. 피어슨 상관계수(r)의 제곱인 결정계수(R²)는 회귀분석에서 모형 설명력을 나타냅니다. 예를 들어 r=0.8이면 R²=0.64로, 독립변수가 종속변수 분산의 64%를 설명합니다. 스피어만 상관계수는 서열형(순위형) 데이터에 적합하며, 명목척도 변수에는 사용할 수 없습니다. 아이스크림 판매량과 익사 사고 건수가 높은 양의 상관관계를 보이지만, 이는 기온이라는 제3의 변수가 원인이지 아이스크림이 익사를 유발하는 것은 아닙니다. 핵심 요약 &amp; 시험 포인트 상관계수 종류 비교 종류 적용 척도 가정 특징 피어슨(Pearson) 등간·비율척도 정규분포, 선형 관계 모수 검정 스피어만(Spearman) 서열·등간·비율척도 없음 (비모수) 순위 기반, 단조 관계 켄달의 타우(Kendall) 서열 이상 없음 (비모수) 소규모 데이터에 강인 상관계수 해석 범위 해석 \ r\ = 1 완전한 선형 관계 0.7 ≤ \ r\ < 1 강한 상관관계 0.3 ≤ \ r\ < 0.7 중간 상관관계 \ r\ < 0.3 약한 상관관계 r = 0 선형 관계 없음 시험 포인트: 상관관계 ≠ 인과관계. 높은 상관이어도 인과관계는 별도 판단 필요. 피어슨 r의 제곱 = R² (결정계수). 명목척도에는 스피어만 사용 불가. 상관계수 종류 비교 상관계수 데이터 유형 관계 유형 가정 Pearson 연속형 (등간/비율) 선형 관계 정규성, 등분산성 Spearman 순서형 또는 연속형 단조(monotonic) 관계 비모수 Kendall (τ) 순서형 단조 관계 비모수, 작은 표본에 강건 편상관계수(Partial Correlation) - 두 변수의 상관에서 다른 변수의 영향을 통제(고정) 한 후의 순수 상관 - 예: 키-시험 점수 상관에서 "나이" 영향 제거 후 분석 상관계수 해석 - r ≥ 0.7: 강한 상관 - 0.3 ≤ r < 0.7: 중간 - r < 0.3: 약한 상관 - r = 0: 선형 관계 없음 (단, 비선형 관계는 있을 수 있음) 시험 포인트:…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>회귀분석</title>
      <link>https://adsp.todaycode.kr/study/27</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/27</guid>
      <pubDate>Wed, 30 Sep 2026 08:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>회귀분석</category>
      <category>로지스틱 회귀</category>
      <category>시계열 분석</category>
      <category>군집분석</category>
      <category>데이터 전처리</category>
      <category>변수 선택</category>
      <category>데이터 기반 의사결정</category>
      <category>데이터 웨어하우스</category>
      <category>점추정·구간추정</category>
      <category>모델 선택 기준</category>
      <description>회귀분석은 하나 이상의 독립변수(원인)가 종속변수(결과)에 미치는 영향을 분석하는 방법입니다. 독립변수가 하나이면 단순회귀분석, 여러 개이면 다중회귀분석이라 합니다. 선형회귀의 본질은 &quot;X 값마다 Y가 어떤 분포를 따르는데, 그 분포의 평균이 직선을 이룬다&quot;는 확률적 가정입니다. 아래 위키미디어 그림(Normdistregression)에서 회귀직선 위에 X마다 작은 정규분포 종 모양이 얹혀 있는 모습이 바로 이 의미입니다 — 각 X에서의 조건부 기댓값 E[Y X]을 잇는 직선이 곧 회귀선이며, 관측값에서 회귀선까지의 거리(잔차)는 평균 0인 정규 오차로 가정됩니다. 이 가정이 선형성·등분산성·정규성·독립성이라는 4대 가정의 기하학적 토대입니다. 선형 회귀의 기본 가정은 네 가지입니다. 선형성(독립변수와 종속변수 간에 선형 관계 존재), 독립성(잔차들이 서로 독립), 등분산성(모든 독립변수 값에 대해 잔차의 분산이 동일), 정규성(잔차가 정규분포를 따름)입니다. 결정계수(R²)는 회귀…</description>
      <content:encoded><![CDATA[<p>회귀분석은 하나 이상의 독립변수(원인)가 종속변수(결과)에 미치는 영향을 분석하는 방법입니다. 독립변수가 하나이면 단순회귀분석, 여러 개이면 다중회귀분석이라 합니다. 선형회귀의 본질은 "X 값마다 Y가 어떤 분포를 따르는데, 그 분포의 평균이 직선을 이룬다"는 확률적 가정입니다. 아래 위키미디어 그림(Normdistregression)에서 회귀직선 위에 X마다 작은 정규분포 종 모양이 얹혀 있는 모습이 바로 이 의미입니다 — 각 X에서의 조건부 기댓값 E[Y X]을 잇는 직선이 곧 회귀선이며, 관측값에서 회귀선까지의 거리(잔차)는 평균 0인 정규 오차로 가정됩니다. 이 가정이 선형성·등분산성·정규성·독립성이라는 4대 가정의 기하학적 토대입니다. 선형 회귀의 기본 가정은 네 가지입니다. 선형성(독립변수와 종속변수 간에 선형 관계 존재), 독립성(잔차들이 서로 독립), 등분산성(모든 독립변수 값에 대해 잔차의 분산이 동일), 정규성(잔차가 정규분포를 따름)입니다. 결정계수(R²)는 회귀모형이 데이터를 얼마나 잘 설명하는지를 나타내며, SSR(회귀제곱합)/SST(총제곱합)=SSR/(SSR+SSE)로 계산합니다. 아래 위키미디어 그림(CoefficientofDetermination)을 보면 R²의 기하학적 의미가 명확합니다. 데이터의 평균선 ȳ을 기준으로 한 전체 분산(SST) 이 두 부분으로 분해됩니다: 회귀선이 평균선으로부터 벌어진 만큼인 설명된 분산(SSR — 빨간색 화살표) 과, 관측값이 회귀선에서 벗어난 만큼인 잔차 분산(SSE — 회색 화살표) 입니다. R² = SSR/SST는 "전체 변동 중 모형이 설명한 비율"이고, R² = 1 - SSE/SST는 "잔차 비율을 1에서 뺀 값"으로 같은 결과를 내며, R²이 1에 가까울수록 회귀선이 데이터 변동을 더 많이 설명합니다. R² = 1 - SSE/SST로도 표현됩니다. R²는 01 사이 값을 가지며 1에 가까울수록 설명력이 높습니다. 다중회귀에서 독립변수를 추가하면 R²는 항상 증가하므로, 변수 수를 고려한 수정 결정계수(Adjusted R²)를 사용합니다. 수정 결정계수 = 1 - (1-R²)×(n-1)/(n-k-1) 으로, 유의하지 않은 변수를 추가하면 오히려 감소합니다. SSE는 오차제곱합이고 SST=SSR+SSE입니다. MSE(평균제곱오차)=SSE/(n-k-1)이며, n은 표본 수, k는 독립변수 수입니다. 단순회귀(k=1)에서는 SSE/(n-2), 다중회귀(k1)에서는 SSE/(n-k-1)이 됩니다. 분모 n-k-1은 자유도(Degrees of Freedom)로, 추정해야 할 파라미터 수(절편 1개 + 독립변수 k개)를 표본 수에서 뺀 값입니다. 다중공선성(Multicollinearity)은 다중회귀분석에서 독립변수들 간에 강한 상관관계가 존재하여 회귀계수의 추정이 불안정해지는 문제입니다. VIF(분산팽창인자) 지표로 측정하며, 해결 방안으로는 상관관계가 높은 변수를 제거하거나, 라쏘(Lasso) 회귀, 릿지(Ridge) 회귀, 엘라스틱넷(Elastic Net) 회귀 등의 정규화 기법을 사용합니다. 릿지(Ridge/L2)는 회귀계수의 크기를 작게 만들되 0으로 만들지 않아 모든 변수를 유지합니다. 라쏘(Lasso/L1)는 일부 회귀계수를 정확히 0으로 만들어 자동으로 변수 선택 효과를 냅니다. 엘라스틱넷은 릿지(L2)와 라쏘(L1)를 결합한 방법입니다. 로지스틱 회귀는 다중공선성을 해결하는 방법이 아닙니다. 변수 선택 방법으로는 전진선택법(변수를 하나씩 추가), 후진제거법(모든 변수에서 하나씩 제거), 단계별 선택법(추가와 제거를 반복)이 있습니다. 핵심 요약 &amp; 시험 포인트 선형 회귀 기본 가정 (선·독·등·정) 가정 의미 선형성 독립변수와 종속변수 간 선형 관계 독립성 잔차들이 서로 독립 등분산성 모든 X 값에서 잔차의 분산이 동일 정규성 잔차가 정규분포를 따름 주요 계산 공식 지표 수식 의미 R² 1 - SSE/SST = SSR/SST 01, 클수록 설명력 높음 수정 R² 1-(1-R²)×(n-1)/(n-k-1) 다중회귀에서 변수 수 보정 MSE S…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>시계열 분석</title>
      <link>https://adsp.todaycode.kr/study/28</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/28</guid>
      <pubDate>Wed, 30 Sep 2026 07:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>빅데이터 3V/5V</category>
      <category>기술통계</category>
      <category>가설검정</category>
      <category>시계열 분석</category>
      <category>변수 변환</category>
      <description>시계열 분석은 시간의 흐름에 따라 관측된 데이터(시계열 데이터)를 분석하여 패턴을 파악하고 미래를 예측하는 방법입니다. 시계열 데이터는 네 가지 구성요소로 분해할 수 있습니다. 추세요인(Trend)은 장기적으로 일정한 방향으로 상승 또는 하락하는 경향입니다. 계절요인(Seasonal)은 일정한 주기를 가지고 반복되는 규칙적인 변동으로, 주기가 고정되어 있습니다. 순환요인(Cyclical)은 경제 순환 등으로 인한 변동으로, 계절요인과 달리 주기가 고정되어 있지 않고 알려지지 않은 주기를 가집니다. 시험에서 &quot;순환요인은 알려진 주기 또는 고정된 주기로 반복된다&quot;는 보기가 나오면 이는 계절요인의 설명이므로 틀린 것입니다. 불규칙요인(Irregular)은 위 세 가지 요인으로 설명할 수 없는 무작위 오차입니다. 정상 시계열이란 시점에 무관하게 평균과 분산이 일정하고, 공분산이 시차(Lag)에만 의존하는(시점에는 의존하지 않는) 시계열을 말합니다. 비정상 시계열을 정상화하는 방법으로는 차분…</description>
      <content:encoded><![CDATA[<p>시계열 분석은 시간의 흐름에 따라 관측된 데이터(시계열 데이터)를 분석하여 패턴을 파악하고 미래를 예측하는 방법입니다. 시계열 데이터는 네 가지 구성요소로 분해할 수 있습니다. 추세요인(Trend)은 장기적으로 일정한 방향으로 상승 또는 하락하는 경향입니다. 계절요인(Seasonal)은 일정한 주기를 가지고 반복되는 규칙적인 변동으로, 주기가 고정되어 있습니다. 순환요인(Cyclical)은 경제 순환 등으로 인한 변동으로, 계절요인과 달리 주기가 고정되어 있지 않고 알려지지 않은 주기를 가집니다. 시험에서 "순환요인은 알려진 주기 또는 고정된 주기로 반복된다"는 보기가 나오면 이는 계절요인의 설명이므로 틀린 것입니다. 불규칙요인(Irregular)은 위 세 가지 요인으로 설명할 수 없는 무작위 오차입니다. 정상 시계열이란 시점에 무관하게 평균과 분산이 일정하고, 공분산이 시차(Lag)에만 의존하는(시점에는 의존하지 않는) 시계열을 말합니다. 비정상 시계열을 정상화하는 방법으로는 차분(데이터 간의 차이를 계산)과 변환(로그 변환 등)이 있습니다. 평균이 일정하지 않으면 차분을, 분산이 일정하지 않으면 변환을 사용합니다. 백색잡음(White Noise)은 평균 0, 일정한 분산을 가지며 자기상관이 없는 정상 시계열입니다. "백색잡음은 비정상 시계열"이라는 보기는 틀린 것입니다. ARIMA(p,d,q) 모델은 자기회귀(AR), 차분(I), 이동평균(MA)을 결합한 모델로, p는 자기회귀 차수, d는 차분 차수, q는 이동평균 차수입니다. 일반적으로 먼저 차분으로 정상성을 확보한 뒤 자기회귀와 이동평균 차수를 결정합니다. 정상성 검정 방법으로는 ADF 검정(Augmented Dickey-Fuller Test)이 대표적입니다. ADF 검정은 단위근(Unit Root) 존재 여부를 통계적으로 검정하여 시계열이 비정상인지 판단합니다. 귀무가설은 "단위근이 존재한다(비정상 시계열)"이며, p-value가 유의수준보다 작으면 귀무가설을 기각하여 정상 시계열로 판단합니다. KPSS 검정은 귀무가설이 "정상 시계열"로 ADF와 반대이므로 주의해야 합니다. KPSS에서 p-value < α이면 귀무가설(정상 시계열) 기각 → 비정상 시계열로 판단합니다. ADF는 p-value < α이면 귀무가설(비정상 시계열) 기각 → 정상 시계열로 판단하므로, 두 검정의 귀무가설이 반대임을 기억해야 합니다. 핵심 요약 &amp; 시험 포인트 시계열 구성요소 4가지 요인 특징 추세(Trend) 장기적 상승/하락 경향 계절(Seasonal) 고정 주기 반복 변동 (주기 알려짐) 순환(Cyclical) 비고정 주기 변동 (주기 미상) 불규칙(Irregular) 무작위 오차 시험 포인트: "순환요인은 고정된 주기로 반복"은 틀린 설명입니다. 이것은 계절요인의 특징입니다. 정상성 확보 &amp; 검정 구분 방법 평균이 비일정 차분(Differencing) 분산이 비일정 로그 변환 또는 Box-Cox 변환 정상성 검정 ADF 검정 (귀무가설: 비정상, p<α → 정상) 시험 포인트: 백색잡음(White Noise)은 정상 시계열입니다. "백색잡음은 비정상"이라는 보기는 틀립니다. ARIMA(p, d, q) - p: 자기회귀(AR) 차수 / d: 차분(I) 차수 / q: 이동평균(MA) 차수 지수평활법 (Exponential Smoothing) 과거 관측값에 지수적으로 감소하는 가중치를 부여해 예측하는 기법입니다. 최근 데이터에 더 큰 가중치. 모형 적용 대상 평활상수 단순 지수평활 추세·계절 없는 시계열 α (수준) 이중 지수평활(Holt) 추세 있음 α(수준) + β(추세) 삼중 지수평활(Holt-Winters) 추세 + 계절 모두 α + β + γ(계절) α 값이 클수록 최근 데이터에 더 큰 비중. α가 작으면 평활 효과↑ 안정성↑. ACF / PACF — ARIMA 모형 식별 함수 의미 ACF(자기상관함수) 시차 k에서의 자기상관 (간접 효과 포함) PACF(편자기상관함수) 중간 시차의 효과를 제거한 순수 상관 ARIMA(p,d,q) 식별 가이드 모형 ACF PACF …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>분류분석 — 의사결정나무·로지스틱 회귀·인공신경망</title>
      <link>https://adsp.todaycode.kr/study/29</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/29</guid>
      <pubDate>Wed, 30 Sep 2026 06:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>기술통계</category>
      <category>확률분포</category>
      <category>로지스틱 회귀</category>
      <category>의사결정나무</category>
      <category>인공신경망</category>
      <category>모형 평가</category>
      <category>교차검증</category>
      <category>과적합</category>
      <category>R 프로그래밍</category>
      <category>데이터 전처리</category>
      <category>텍스트 마이닝</category>
      <category>확률</category>
      <category>거리 측정</category>
      <category>활성화 함수</category>
      <category>강화학습·지도학습</category>
      <category>분류 임계값</category>
      <description>분류분석은 이미 분류된(레이블이 있는) 데이터를 바탕으로 새로운 데이터가 어느 그룹에 속할지 예측하는 지도학습 방법입니다. 신용등급 예측, 스팸메일 분류, 질병 진단 등이 대표적 사례입니다. &quot;아파트 가격 예측&quot;은 연속형 수치를 예측하는 회귀 문제이므로 분류분석이 아닙니다. 의사결정나무(Decision Tree)는 데이터를 특정 기준으로 반복적으로 분할하여 나무 형태의 구조를 만드는 방법입니다. 분할 기준으로 지니지수(Gini Index)나 엔트로피(Entropy)를 사용하며, 자식 마디의 순수도(한 범주의 비율)가 최대가 되도록 분류합니다. 지니지수는 1-Σ(Pᵢ²)로 계산하며, 값이 작을수록 순수합니다(CART 알고리즘 사용). 엔트로피는 -Σ(Pᵢ × log₂Pᵢ)로 계산하며, 값이 0에 가까울수록 순수하고 1에 가까울수록 불순합니다(C4.5 알고리즘 사용). 정보이득(Information Gain)은 분기 전후의 엔트로피 감소량으로, 정보이득이 클수록 좋은 분할 기준입니다. …</description>
      <content:encoded><![CDATA[<p>분류분석은 이미 분류된(레이블이 있는) 데이터를 바탕으로 새로운 데이터가 어느 그룹에 속할지 예측하는 지도학습 방법입니다. 신용등급 예측, 스팸메일 분류, 질병 진단 등이 대표적 사례입니다. "아파트 가격 예측"은 연속형 수치를 예측하는 회귀 문제이므로 분류분석이 아닙니다. 의사결정나무(Decision Tree)는 데이터를 특정 기준으로 반복적으로 분할하여 나무 형태의 구조를 만드는 방법입니다. 분할 기준으로 지니지수(Gini Index)나 엔트로피(Entropy)를 사용하며, 자식 마디의 순수도(한 범주의 비율)가 최대가 되도록 분류합니다. 지니지수는 1-Σ(Pᵢ²)로 계산하며, 값이 작을수록 순수합니다(CART 알고리즘 사용). 엔트로피는 -Σ(Pᵢ × log₂Pᵢ)로 계산하며, 값이 0에 가까울수록 순수하고 1에 가까울수록 불순합니다(C4.5 알고리즘 사용). 정보이득(Information Gain)은 분기 전후의 엔트로피 감소량으로, 정보이득이 클수록 좋은 분할 기준입니다. 가지치기(Pruning)는 과적합을 방지하기 위해 불필요한 가지를 제거하는 것으로, 학습 데이터에서의 정확도는 오히려 낮아질 수 있지만 일반화 성능은 향상됩니다. 로지스틱 회귀는 종속변수가 범주형(예: 성공/실패, 합격/불합격)일 때 사용하는 분류 모델입니다. 시그모이드(Sigmoid) 함수를 사용하여 출력값을 0과 1 사이로 변환합니다. 로지스틱 회귀에서 오즈(Odds) = P(Y=1)/P(Y=0)로, 사건이 발생할 확률을 발생하지 않을 확률로 나눈 비율입니다. 회귀계수 β의 오즈비(Odds Ratio) = exp(β)는 설명변수가 1단위 증가할 때 오즈가 변화하는 배율을 의미합니다. 오즈비가 1보다 크면 양의 영향(사건 발생 확률 증가), 1보다 작으면 음의 영향을 의미합니다. 즉 오즈는 "비율 자체"이고, 오즈비는 "X 변화에 따른 오즈의 증가 배율"입니다. 인공신경망(ANN)은 인간 뇌의 뉴런 구조를 모방한 모델로, 입력층-은닉층-출력층으로 구성됩니다. 은닉층이 없으면 로지스틱 회귀와 동일하게 작동합니다. 활성화 함수로는 시그모이드(출력 01), ReLU(입력이 양수면 그대로, 음수면 0), 하이퍼볼릭 탄젠트(출력 -11), 소프트맥스(다중 클래스 분류 시 사용) 등이 있습니다. 가중치 개수는 (이전 층 노드 수 × 다음 층 노드 수)의 합으로 계산합니다. 핵심 요약 &amp; 시험 포인트 의사결정나무 분할 기준 비교 기준 수식 특징 지니지수 1-Σ(Pᵢ²) 0에 가까울수록 순수, CART 알고리즘 엔트로피 -Σ(Pᵢ×log₂Pᵢ) 0=완전 순수, 1=완전 불순, C4.5 알고리즘 정보이득 분기 전 엔트로피 - 분기 후 엔트로피 클수록 좋은 분할 시험 포인트: 가지치기(Pruning)는 학습 데이터 정확도를 낮추더라도 일반화 성능을 높이는 것이 목적입니다. 오즈(Odds) vs 오즈비(Odds Ratio) 개념 수식 의미 오즈(Odds) P(Y=1)/P(Y=0) 발생 확률÷비발생 확률 오즈비(Odds Ratio) exp(β) X가 1단위 증가할 때 오즈가 변화하는 배율 시험 포인트: "설명변수가 1단위 증가할 때 오즈의 증가율"은 오즈비(exp(β))입니다. 오즈 자체가 아님에 주의! 활성화 함수 비교 함수 출력 범위 용도 시그모이드 01 이진 분류(출력층), 로지스틱 회귀와 동일 ReLU 0 또는 입력값 은닉층 (기울기 소실 방지) 하이퍼볼릭 탄젠트 -11 은닉층 소프트맥스 합=1 다중 클래스 분류(출력층) SVM (Support Vector Machine) SVM은 두 클래스를 분리하는 초평면(Hyperplane) 중 마진(Margin)이 최대가 되는 평면을 찾는 분류 기법입니다. 💡 한 줄 직관: 두 그룹 사이에 가장 넓은 도로(마진)를 긋는다. 도로의 가장자리(갓길)에 정확히 닿는 점들이 서포트 벡터(Support Vector), 도로의 한가운데를 지나는 가상의 선이 초평면(Hyperplane). 핵심 4개념 (그림과 함께) 개념 그림에서의 위치 한 줄 정의 초평면(Hyperplane) 가운데 두꺼운 검은 선 (w·x − b =…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>앙상블 기법 — 배깅·부스팅·랜덤포레스트</title>
      <link>https://adsp.todaycode.kr/study/30</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/30</guid>
      <pubDate>Wed, 30 Sep 2026 05:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>데이터 유형</category>
      <category>분석 주제 유형</category>
      <category>기술통계</category>
      <category>회귀분석</category>
      <category>의사결정나무</category>
      <category>앙상블</category>
      <category>랜덤포레스트</category>
      <category>과적합</category>
      <category>데이터 전처리</category>
      <category>부트스트랩</category>
      <category>표본조사</category>
      <description>앙상블(Ensemble)은 여러 개의 모델을 결합하여 하나의 더 강력한 예측 모델을 만드는 기법입니다. 단일 모델의 약점을 보완하여 전체적인 예측 성능을 향상시키는 것이 목적입니다. 배깅(Bagging, Bootstrap Aggregating)은 복원추출 방식의 부트스트랩으로 여러 개의 훈련 데이터 세트를 만들고, 각각으로 독립적인 모델을 학습시킨 후 결과를 종합합니다. 분류 문제에서는 다수결 투표(Voting), 회귀 문제에서는 평균을 사용합니다. 각 모델이 독립적으로 병렬 학습되는 것이 특징입니다. 랜덤포레스트(Random Forest)는 배깅을 기반으로 복수의 의사결정나무를 생성하고 예측을 종합하는 대표적인 앙상블 기법입니다. 부스팅(Boosting)은 약한 학습기를 순차적으로 학습시키면서, 이전 모델이 잘못 분류한 데이터에 더 큰 가중치를 부여하여 다음 모델이 이를 더 잘 학습하도록 하는 방법입니다. 배깅과 달리 모델 간에 의존성이 있으며 순차적으로 학습됩니다. 시험에서 &quot;부…</description>
      <content:encoded><![CDATA[<p>앙상블(Ensemble)은 여러 개의 모델을 결합하여 하나의 더 강력한 예측 모델을 만드는 기법입니다. 단일 모델의 약점을 보완하여 전체적인 예측 성능을 향상시키는 것이 목적입니다. 배깅(Bagging, Bootstrap Aggregating)은 복원추출 방식의 부트스트랩으로 여러 개의 훈련 데이터 세트를 만들고, 각각으로 독립적인 모델을 학습시킨 후 결과를 종합합니다. 분류 문제에서는 다수결 투표(Voting), 회귀 문제에서는 평균을 사용합니다. 각 모델이 독립적으로 병렬 학습되는 것이 특징입니다. 랜덤포레스트(Random Forest)는 배깅을 기반으로 복수의 의사결정나무를 생성하고 예측을 종합하는 대표적인 앙상블 기법입니다. 부스팅(Boosting)은 약한 학습기를 순차적으로 학습시키면서, 이전 모델이 잘못 분류한 데이터에 더 큰 가중치를 부여하여 다음 모델이 이를 더 잘 학습하도록 하는 방법입니다. 배깅과 달리 모델 간에 의존성이 있으며 순차적으로 학습됩니다. 시험에서 "부스팅은 개별 모델에 동일한 가중치를 부여한다"는 보기가 나오면 틀린 것입니다. 가중치를 다르게 부여하여 오분류 데이터에 집중하는 것이 부스팅의 핵심입니다. 또한 "앙상블은 항상 단일 모형보다 정확하다"는 보기도 항상 그런 것은 아니므로 틀립니다. 그래디언트 부스팅(Gradient Boosting)은 이전 모델의 잔차(오차)를 다음 모델이 학습하는 부스팅 기법입니다. XGBoost(eXtreme Gradient Boosting)는 그래디언트 부스팅을 최적화하여 속도와 성능을 개선한 알고리즘으로, 정형 데이터 분류·회귀에서 높은 성능을 보입니다. 과적합 방지를 위한 정규화 옵션도 내장되어 있습니다. LightGBM은 XGBoost보다 학습 속도가 빠르고 메모리 효율이 높은 그래디언트 부스팅 알고리즘으로, 대용량 데이터에 적합합니다. 핵심 요약 &amp; 시험 포인트 앙상블 기법 비교 기법 학습 방식 특징 배깅(Bagging) 병렬 (복원추출) 분산 감소, 과적합 방지 부스팅(Boosting) 순차 (오류 가중치) 편향 감소, 과적합 위험 랜덤포레스트 병렬 + 변수 무작위 선택 배깅 + 변수 임의 선택 스태킹(Stacking) 메타 학습기 결합 여러 모델 예측을 재학습 그래디언트 부스팅 계열 알고리즘 특징 XGBoost 그래디언트 부스팅 최적화, 정규화 내장 LightGBM XGBoost보다 빠르고 메모리 효율 높음, 대용량 적합 시험 포인트: 배깅=병렬·복원추출, 부스팅=순차·오류 가중치. 랜덤포레스트는 OOB(Out-Of-Bag) 샘플(≈36.8%)로 검증 가능. 부스팅 알고리즘 변천 알고리즘 등장 특징 AdaBoost (1996) 오리지널 오분류 데이터에 가중치 증가, 약한 학습기(주로 stump) 결합 GBM (Gradient Boosting Machine) 손실 함수의 경사 방향으로 학습 잔차 학습, 일반화된 부스팅 XGBoost (2014) GBM + 정규화 + 병렬 처리 Kaggle 우승 단골, 정형 데이터 최강 LightGBM (2017) Microsoft, 리프 우선(Leaf-wise) 분할 XGBoost보다 빠름, 대용량 적합 CatBoost (2017) Yandex, 범주형 자동 처리 범주형 변수 인코딩 불필요, Ordered Boosting AdaBoost 핵심 원리 1. 모든 데이터에 동일 가중치로 시작 2. 약한 학습기 학습 → 오분류 데이터의 가중치 증가 3. 다음 학습기는 어려운 데이터에 집중 4. 최종 예측은 학습기들의 가중 투표 CatBoost의 차별점 - 범주형 변수를 타깃 인코딩 + 순서 통계로 자동 처리 - 일반적인 원-핫 인코딩의 차원 폭발 방지 - Ordered Boosting으로 과적합 방지 시험 포인트: AdaBoost = 오분류 가중치 조정. GBM 계열 = 잔차 학습. CatBoost = 범주형 자동 처리. 랜덤 포레스트(Random Forest) 심화 - 배깅 + 변수 무작위 선택을 결합한 의사결정나무 앙상블 - 각 분할마다 전체 변수 중 √p(분류) 또는 p/3(회귀)개만 후보로 사용 → 트리 간 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>군집분석</title>
      <link>https://adsp.todaycode.kr/study/31</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/31</guid>
      <pubDate>Wed, 30 Sep 2026 04:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>기술통계</category>
      <category>인공신경망</category>
      <category>군집분석</category>
      <category>차원 축소</category>
      <category>변수 선택</category>
      <category>판별분석</category>
      <category>텍스트 마이닝</category>
      <category>거리 측정</category>
      <category>이상치·결측</category>
      <category>데이터 기반 의사결정</category>
      <category>강화학습·지도학습</category>
      <description>군집분석은 유사한 특성을 가진 데이터들을 자동으로 그룹(군집)으로 묶는 비지도학습 방법입니다. 분류분석과 달리 미리 정해진 그룹이 없는 상태에서 데이터 자체의 패턴을 기반으로 그룹을 형성합니다. K-Means는 가장 대표적인 비계층적 군집분석 기법입니다. K-Means는 이상치(Outlier)에 민감하다는 단점이 있습니다. 이를 보완한 K-medoids(PAM, Partitioning Around Medoids)는 중심점으로 평균 대신 실제 데이터 포인트(대표 개체)를 사용하므로 이상치에 강합니다. 먼저 무작위로 K개의 초기 중심점을 설정한 후, 각 데이터를 가장 가까운 중심점에 할당하고, 각 군집의 중심점을 재계산하는 과정을 수렴할 때까지 반복합니다. 시험에서 &quot;군집 개수 K를 알고리즘이 자동으로 선택한다&quot;는 보기가 나오면 틀린 것입니다. K는 사용자가 미리 지정해야 합니다. 또한 &quot;초기 중심값 설정은 결과에 영향을 주지 않는다&quot;도 틀린 설명입니다. 최적 K를 결정하는 방법으로는 …</description>
      <content:encoded><![CDATA[<p>군집분석은 유사한 특성을 가진 데이터들을 자동으로 그룹(군집)으로 묶는 비지도학습 방법입니다. 분류분석과 달리 미리 정해진 그룹이 없는 상태에서 데이터 자체의 패턴을 기반으로 그룹을 형성합니다. K-Means는 가장 대표적인 비계층적 군집분석 기법입니다. K-Means는 이상치(Outlier)에 민감하다는 단점이 있습니다. 이를 보완한 K-medoids(PAM, Partitioning Around Medoids)는 중심점으로 평균 대신 실제 데이터 포인트(대표 개체)를 사용하므로 이상치에 강합니다. 먼저 무작위로 K개의 초기 중심점을 설정한 후, 각 데이터를 가장 가까운 중심점에 할당하고, 각 군집의 중심점을 재계산하는 과정을 수렴할 때까지 반복합니다. 시험에서 "군집 개수 K를 알고리즘이 자동으로 선택한다"는 보기가 나오면 틀린 것입니다. K는 사용자가 미리 지정해야 합니다. 또한 "초기 중심값 설정은 결과에 영향을 주지 않는다"도 틀린 설명입니다. 최적 K를 결정하는 방법으로는 엘보우 방법(Elbow Method)과 실루엣 계수(Silhouette Coefficient)가 있습니다. 엘보우 방법은 K 값에 따른 군집 내 제곱합(WSS, Within-cluster Sum of Squares)을 그래프로 그려서 감소 기울기가 급격히 완만해지는 꺾이는 지점(Elbow Point)을 최적 K로 선택합니다. 실루엣 계수는 -1에서 1 사이의 값으로, 군집 내 응집도와 군집 간 분리도를 종합하여 군집 품질을 평가합니다. 값이 1에 가까울수록 이상적인 군집화이며, 0에 가까우면 군집 경계에 위치하고, 음수이면 잘못 분류된 것입니다. 계층적 군집분석은 데이터를 단계적으로 합치거나 나누면서 계층적 구조(덴드로그램)를 형성합니다. 군집 간 거리 측정 방법으로 단일연결법(최단 거리), 최장연결법(최대 거리), 평균연결법(평균 거리), 와드연결법(군집 내 오차제곱합 SSE를 최소화)이 있습니다. DBSCAN은 밀도 기반 군집화 방식으로 군집 개수를 미리 정할 필요가 없으며, 초기 중심값도 불필요합니다. SOM(자기조직화지도)은 경쟁학습 기반 신경망으로 차원 축소와 군집화를 동시에 수행합니다. 유사도(거리) 측정에는 유클리디안 거리, 맨하탄 거리, 마할라노비스 거리(변수 간 상관관계를 고려), 자카드 거리(범주형 데이터 간 유사도) 등이 사용됩니다. 자카드 거리는 연속형이 아닌 범주형 데이터에 적합하므로, "연속형 변수 간 거리 측정 방법"으로는 부적절합니다. 핵심 요약 &amp; 시험 포인트 군집분석 기법 비교 기법 유형 K 사전지정 특징 K-Means 비계층적 필요 구형 군집, 초기 중심값에 민감 계층적 군집 계층적 불필요 덴드로그램 시각화, 와드연결법(SSE 최소화) DBSCAN 밀도 기반 불필요 비구형 군집, 이상치 탐지 SOM 신경망 필요 차원 축소 + 군집화 동시 수행 최적 K 결정 방법 방법 설명 엘보우(Elbow) WSS 그래프에서 기울기가 급격히 완만해지는 지점 실루엣 계수 -11 범위, 1에 가까울수록 이상적 군집화 시험 포인트: K-Means는 K를 분석가가 사전 지정해야 합니다. DBSCAN은 K 지정이 불필요합니다. 유사도·거리 측정법 종합 정리 연속형 변수 거리 측정법 수식 특징 유클리드(Euclidean) √Σ(xᵢ-yᵢ)² 가장 일반적, 직선 거리 맨해튼(Manhattan) Σ\ xᵢ-yᵢ\ L1 거리, 격자 거리 민코프스키(Minkowski) (Σ\ xᵢ-yᵢ\ ^p)^(1/p) 일반화 거리 (p=1: 맨해튼, p=2: 유클리드) 체비셰프(Chebyshev) max\ xᵢ-yᵢ\ 민코프스키 p→∞, 체스의 킹 마할라노비스(Mahalanobis) 변수 간 공분산 고려 변수 상관·스케일 보정 범주형/특수 데이터 거리 측정법 수식 사용처 자카드(Jaccard) \ A∩B\ /\ A∪B\ 집합·이진 데이터 (0과 1) 코사인 유사도(Cosine) A·B / (\ A\ ·\ B\ ) 텍스트 (TF-IDF), 고차원 벡터 편집 거리(Levenshtein) 삽입·삭제·교체 횟수 문자열 비교 해밍(Hamming) 다른 위치의…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>연관분석</title>
      <link>https://adsp.todaycode.kr/study/32</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/32</guid>
      <pubDate>Wed, 30 Sep 2026 03:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>데이터베이스</category>
      <category>분석 주제 유형</category>
      <category>상관분석</category>
      <category>의사결정나무</category>
      <category>연관분석</category>
      <category>탐색적 분석</category>
      <description>연관분석은 데이터 속에서 항목들 간의 관련성(연관규칙)을 발견하는 분석 기법입니다. &quot;기저귀를 사는 고객이 맥주도 함께 산다&quot;는 장바구니 분석이 가장 유명한 사례입니다. 연관분석의 세 가지 핵심 지표가 있습니다. 지지도(Support)는 전체 거래 중에서 A와 B를 동시에 구매한 거래의 비율입니다. 수식으로는 P(A∩B)=A와B 동시구매건수/전체거래건수입니다. 신뢰도(Confidence)는 A를 구매한 거래 중에서 B도 함께 구매한 비율입니다. 수식으로는 P(B A)=P(A∩B)/P(A)입니다. 향상도(Lift)는 A를 구매한 사람이 B를 구매할 확률이, B의 전체 구매 확률에 비해 얼마나 높은지를 나타냅니다. 수식으로는 P(B A)/P(B)=신뢰도/P(B)입니다. 향상도가 1보다 크면 양의 연관성, 1이면 독립(무관), 1보다 작으면 음의 연관성입니다. Apriori 알고리즘은 연관규칙을 찾는 대표적 알고리즘으로, 최소 지지도를 설정→개별 품목 중 최소 지지도를 넘는 품목 선별→2…</description>
      <content:encoded><![CDATA[<p>연관분석은 데이터 속에서 항목들 간의 관련성(연관규칙)을 발견하는 분석 기법입니다. "기저귀를 사는 고객이 맥주도 함께 산다"는 장바구니 분석이 가장 유명한 사례입니다. 연관분석의 세 가지 핵심 지표가 있습니다. 지지도(Support)는 전체 거래 중에서 A와 B를 동시에 구매한 거래의 비율입니다. 수식으로는 P(A∩B)=A와B 동시구매건수/전체거래건수입니다. 신뢰도(Confidence)는 A를 구매한 거래 중에서 B도 함께 구매한 비율입니다. 수식으로는 P(B A)=P(A∩B)/P(A)입니다. 향상도(Lift)는 A를 구매한 사람이 B를 구매할 확률이, B의 전체 구매 확률에 비해 얼마나 높은지를 나타냅니다. 수식으로는 P(B A)/P(B)=신뢰도/P(B)입니다. 향상도가 1보다 크면 양의 연관성, 1이면 독립(무관), 1보다 작으면 음의 연관성입니다. Apriori 알고리즘은 연관규칙을 찾는 대표적 알고리즘으로, 최소 지지도를 설정→개별 품목 중 최소 지지도를 넘는 품목 선별→2개 이상의 품목 조합으로 확장→반복하여 빈발 항목 집합을 발견하는 순서로 진행됩니다. Apriori의 핵심 원리는 반단조성(Anti-monotone property): 빈발하지 않는 항목 집합의 상위 집합은 빈발하지 않으므로 탐색을 가지치기합니다. 그러나 데이터 스캔 횟수가 많아 대용량 데이터에 비효율적이라는 단점이 있습니다. FP-Growth 알고리즘은 데이터를 FP-Tree 자료구조로 압축하여 반복 스캔 없이 연관규칙을 탐색하는 개선된 알고리즘입니다. Apriori는 데이터베이스를 여러 번 스캔해야 하는 반면, FP-Growth는 2회 스캔으로 FP-Tree를 구성하므로 대용량 데이터에 더 효율적입니다. 다만 FP-Tree를 메모리에 유지해야 하므로 데이터가 매우 희소(Sparse)하면 메모리 비용이 증가할 수 있습니다. 연관분석의 장점은 조건반응(If-then) 기반으로 결과 해석이 쉽고, 특별한 목적 없이도 데이터 탐색이 가능하며, 데이터 변환 없이 원본을 그대로 사용할 수 있다는 점입니다. "연관분석은 변수 간 선형 관계를 파악하는 방법"이라는 보기가 나오면 이는 상관분석의 설명이므로 틀린 것입니다. 핵심 요약 &amp; 시험 포인트 연관규칙 3대 지표 수식 지표 수식 의미 지지도(Support) P(A∩B) = (A,B 동시)/(전체) 전체에서 함께 구매 비율 신뢰도(Confidence) P(B\ A) = P(A∩B)/P(A) A구매 중 B도 구매 비율 향상도(Lift) 신뢰도/P(B) 1독립, 1=무관, 1<양의 연관 Apriori vs FP-Growth 알고리즘 특징 장점 단점 Apriori 반단조성(Anti-monotone) 활용 이해 쉬움 반복 스캔으로 느림 FP-Growth FP-Tree로 2회 스캔 빠름, 대용량 적합 희소 데이터 시 메모리↑ 시험 포인트: 향상도1이면 양의 연관성. Apriori 핵심: 빈발하지 않는 항목집합의 상위집합도 빈발하지 않음(반단조성). 연관분석 ≠ 변수 간 선형 관계(그것은 상관분석). 연관규칙 마이닝 핵심 원리 - Association Rule Mining: 항목 집합 사이의 IF-THEN 규칙 추출 (예: 빵 → 우유) - 장바구니 분석(Market Basket Analysis): 함께 구매되는 상품 집합 분석 — 연관규칙의 대표 응용 - Downward Closure(하향 닫힘 / 반(反)단조성): "빈발 집합의 모든 부분집합도 빈발이다" - 대우: 비빈발 집합의 모든 상위 집합도 비빈발 → Apriori 알고리즘의 가지치기 핵심 원리 교차판매·상향판매 - Cross-Sell(교차판매): 연관 상품 추천 (보험 + 적금) - Up-Sell(상향판매): 더 비싼 모델·옵션 추천 (스탠다드 → 프리미엄) 연관규칙 표현 - 발생 규칙(If A then B): 항목 A가 등장하면 B가 함께 등장하는 규칙 - Antecedent(전건, A) → Consequent(후건, B) - 평가 지표: Support·Confidence·Lift·Conviction·Leverage Apriori 알고리즘 핵심…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>차원 축소 — 주성분분석(PCA)과 다차원척도법(MDS)</title>
      <link>https://adsp.todaycode.kr/study/33</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/33</guid>
      <pubDate>Wed, 30 Sep 2026 02:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>빅데이터 3V/5V</category>
      <category>기술통계</category>
      <category>인공신경망</category>
      <category>차원 축소</category>
      <category>과적합</category>
      <category>데이터 전처리</category>
      <category>판별분석</category>
      <category>데이터 기반 의사결정</category>
      <category>추천 시스템</category>
      <category>강화학습·지도학습</category>
      <description>차원 축소는 많은 변수를 가진 데이터에서 핵심적인 정보만 추출하여 변수의 수를 줄이는 기법입니다. 변수가 너무 많으면 분석이 복잡해지고 과적합이 발생할 수 있기 때문입니다. 주성분분석(PCA, Principal Component Analysis)은 상관관계가 높은 여러 변수들을 선형 결합하여 더 적은 수의 새로운 변수(주성분)를 만들어내는 비지도학습 기법입니다. 각 주성분은 원래 데이터의 분산을 최대한 설명하는 방향으로 생성되며, 첫 번째 주성분이 가장 많은 분산(정보)을 담습니다. 주성분 간에는 상관관계가 없다(직교한다)는 것이 중요한 특징입니다. 시험에서 &quot;주성분 간에는 상관관계가 있다&quot;는 보기가 나오면 틀린 것입니다. 주성분의 수는 변수의 수보다 작거나 같으며, Scree plot에서 고유값(Eigenvalue)이 급격히 감소하는 지점(elbow point)까지의 주성분을 유의미하다고 판단합니다. Kaiser 기준으로는 고유값이 1 이상인 주성분을 선택합니다. 누적 분산 설명 …</description>
      <content:encoded><![CDATA[<p>차원 축소는 많은 변수를 가진 데이터에서 핵심적인 정보만 추출하여 변수의 수를 줄이는 기법입니다. 변수가 너무 많으면 분석이 복잡해지고 과적합이 발생할 수 있기 때문입니다. 주성분분석(PCA, Principal Component Analysis)은 상관관계가 높은 여러 변수들을 선형 결합하여 더 적은 수의 새로운 변수(주성분)를 만들어내는 비지도학습 기법입니다. 각 주성분은 원래 데이터의 분산을 최대한 설명하는 방향으로 생성되며, 첫 번째 주성분이 가장 많은 분산(정보)을 담습니다. 주성분 간에는 상관관계가 없다(직교한다)는 것이 중요한 특징입니다. 시험에서 "주성분 간에는 상관관계가 있다"는 보기가 나오면 틀린 것입니다. 주성분의 수는 변수의 수보다 작거나 같으며, Scree plot에서 고유값(Eigenvalue)이 급격히 감소하는 지점(elbow point)까지의 주성분을 유의미하다고 판단합니다. Kaiser 기준으로는 고유값이 1 이상인 주성분을 선택합니다. 누적 분산 설명 비율이 7080% 이상이 되는 시점까지 주성분을 선택하기도 합니다. 주의: PCA 수행 전에 변수 간 척도가 다른 경우 반드시 표준화(Standardization)를 적용해야 합니다. 그렇지 않으면 분산이 큰 변수가 첫 번째 주성분을 지배하게 됩니다. 다차원척도법(MDS, Multidimensional Scaling)은 개체들 간의 거리 정보를 2차원이나 3차원 공간에 시각화하여, 유사한 개체는 가깝게 다른 개체는 멀게 배치하는 기법입니다. 영화 간 유사성 분석, 브랜드 포지셔닝 분석 등에 활용됩니다. MDS는 상대적 위치 관계를 보여주는 것이지 절대적 위치를 알 수 있는 것은 아닙니다. "MDS로 절대적 위치를 알 수 있다"는 보기가 나오면 틀린 것입니다. 핵심 요약 &amp; 시험 포인트 PCA vs MDS 비교 기법 목적 입력 출력 PCA 분산 최대 보존하여 차원 축소 원본 데이터 행렬 주성분(직교 벡터) MDS 거리 정보 보존하여 저차원 시각화 거리·비유사성 행렬 저차원 좌표 PCA 핵심 사항 항목 설명 주성분 수 최대 원래 변수 수와 동일 주성분 간 관계 서로 직교(무상관) 분산 설명량 1번 주성분 2번 3번 순서로 감소 전처리 필수 변수 단위가 다르면 표준화 필요 시험 포인트: MDS는 상대적 위치 관계만 표현 (절대적 위치 불가). PCA는 비지도학습으로 레이블 없이 차원 축소. PCA 적용 전 변수 척도가 다르면 반드시 표준화. 차원 축소 기법 종합 선형 차원 축소 기법 학습 목적 PCA (주성분분석) 비지도 분산 최대화 SVD (특이값 분해) 비지도 X = UΣV^T 행렬 분해, PCA의 일반화 LDA (선형판별분석) 지도 (레이블 사용) 클래스 분리 최대화 MDS (다차원척도법) 비지도 개체 간 거리 보존 비선형 차원 축소 기법 특징 t-SNE 비선형, 시각화 특화, 군집 보존 (전역 구조 약함) UMAP t-SNE보다 빠름, 전역 구조도 보존 Autoencoder 신경망 기반, 인코더+디코더 Kernel PCA 커널 트릭으로 비선형 PCA LDA vs PCA — 헷갈리는 두 차원축소 구분 LDA (Linear Discriminant Analysis) PCA (Principal Component Analysis) 학습 유형 지도학습 (클래스 레이블 사용) 비지도학습 목적 클래스 간 분산 최대화 / 내 분산 최소화 전체 분산 최대화 결과 컴포넌트 수 최대 (클래스 수 - 1) 변수 수까지 사용처 분류 전 차원 축소 일반 차원 축소·시각화 ⚠️ 주의: 토픽 모델링 LDA(Latent Dirichlet Allocation)와 다른 알고리즘! 차원축소 LDA = Linear Discriminant Analysis (선형판별분석) SVD 활용 사례 - PCA의 계산: PCA는 공분산 행렬의 SVD로 계산 가능 - 추천 시스템: 사용자×아이템 행렬을 분해하여 잠재 요인 추출 - LSA(Latent Semantic Analysis): 텍스트 차원 축소 시험 포인트: PCA는 비지도, LDA는 지도. SVD는 PCA의 수학적 일반화. t-S…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>모형 평가 지표</title>
      <link>https://adsp.todaycode.kr/study/34</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/34</guid>
      <pubDate>Wed, 30 Sep 2026 01:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>회귀분석</category>
      <category>군집분석</category>
      <category>연관분석</category>
      <category>모형 평가</category>
      <category>ROC 곡선</category>
      <category>교차검증</category>
      <category>부트스트랩</category>
      <category>이상치·결측</category>
      <category>표본조사</category>
      <category>분류 임계값</category>
      <description>분류 모형의 성능을 평가하기 위한 다양한 지표가 있으며, 이를 이해하려면 먼저 오분류표(혼동행렬, Confusion Matrix)를 알아야 합니다. 오분류표는 실제값과 예측값의 조합으로 네 가지 결과를 보여줍니다. TP(True Positive)는 실제 참을 참으로 올바르게 예측한 것, FP(False Positive)는 실제 거짓을 참으로 잘못 예측한 것, FN(False Negative)는 실제 참을 거짓으로 잘못 예측한 것, TN(True Negative)는 실제 거짓을 거짓으로 올바르게 예측한 것입니다. 정확도(Accuracy)는 전체 예측 중 올바르게 예측한 비율로, (TP+TN)/(TP+FP+FN+TN)입니다. 정밀도(Precision)는 모델이 참이라고 예측한 것 중 실제로도 참인 비율로, TP/(TP+FP)입니다. 재현율(Recall, 민감도, Sensitivity)은 실제 참인 것 중 모델이 참으로 올바르게 예측한 비율로, TP/(TP+FN)입니다. F1-Score는…</description>
      <content:encoded><![CDATA[<p>분류 모형의 성능을 평가하기 위한 다양한 지표가 있으며, 이를 이해하려면 먼저 오분류표(혼동행렬, Confusion Matrix)를 알아야 합니다. 오분류표는 실제값과 예측값의 조합으로 네 가지 결과를 보여줍니다. TP(True Positive)는 실제 참을 참으로 올바르게 예측한 것, FP(False Positive)는 실제 거짓을 참으로 잘못 예측한 것, FN(False Negative)는 실제 참을 거짓으로 잘못 예측한 것, TN(True Negative)는 실제 거짓을 거짓으로 올바르게 예측한 것입니다. 정확도(Accuracy)는 전체 예측 중 올바르게 예측한 비율로, (TP+TN)/(TP+FP+FN+TN)입니다. 정밀도(Precision)는 모델이 참이라고 예측한 것 중 실제로도 참인 비율로, TP/(TP+FP)입니다. 재현율(Recall, 민감도, Sensitivity)은 실제 참인 것 중 모델이 참으로 올바르게 예측한 비율로, TP/(TP+FN)입니다. F1-Score는 정밀도와 재현율의 조화평균으로, F1 = 2×(정밀도×재현율)/(정밀도+재현율) = 2×TP/(2×TP+FP+FN)으로 계산합니다. 정밀도와 재현율이 동시에 높아야 F1이 높으므로, 두 지표의 균형을 평가할 때 사용합니다. 재현율을 더 중요시하면 Fβ-Score(β1), 정밀도를 더 중요시하면 Fβ-Score(β<1)를 사용합니다. 특이도(Specificity)는 실제 거짓인 것 중 모델이 거짓으로 올바르게 예측한 비율로, TN/(FP+TN)입니다. ROC 곡선(Receiver Operating Characteristic Curve)은 X축에 1-특이도(FPR, 거짓 양성률), Y축에 민감도(TPR, 참 양성률)를 놓고 그린 곡선입니다. 곡선이 왼쪽 상단 모서리(0,1)에 가까울수록 좋은 모형이며, AUC(곡선 아래 면적)가 1에 가까울수록 우수한 분류 성능을 의미합니다. 가장 이상적인 점은 (0,1) 좌표, 즉 거짓 양성률이 0이고 참 양성률이 1인 지점입니다. AUC 값 기준으로는 0.9 이상이면 우수, 0.70.9이면 적절, 0.5에 가까울수록 무작위 분류와 유사합니다. "AUC가 클수록 성능이 나쁘다"는 보기가 나오면 반대이므로 틀린 설명입니다. 향상도 곡선(Lift Curve)은 랜덤 모델 대비 분류 모델의 성과 향상 정도를 각 등급별로 나타내는 그래프입니다. 이익도표(Gains Chart)는 분류 모델을 적용했을 때 각 등급에 포함되는 관측치 수를 보여줍니다. 향상도 값이 클수록 해당 등급에서 모델이 랜덤 대비 더 효과적임을 의미합니다. 핵심 요약 &amp; 시험 포인트 혼동행렬(Confusion Matrix) 예측 Positive 예측 Negative -- 실제 Positive TP (참 양성) FN (위음성) 실제 Negative FP (위양성) TN (참 음성) 주요 평가 지표 수식 지표 수식 의미 정확도 (TP+TN)/(TP+FP+FN+TN) 전체 중 올바른 예측 비율 정밀도 TP/(TP+FP) 양성 예측 중 실제 양성 비율 재현율(민감도) TP/(TP+FN) 실제 양성 중 예측 양성 비율 특이도 TN/(FP+TN) 실제 음성 중 예측 음성 비율 F1-Score 2×P×R/(P+R) 정밀도와 재현율의 조화평균 시험 포인트: ROC X축=1-특이도(FPR), Y축=민감도(TPR). AUC가 1에 가까울수록 우수한 모형입니다. 교차검증 (Cross-Validation) 모형의 일반화 성능을 신뢰성 있게 평가하기 위해 데이터를 여러 차례 나눠 검증하는 방법입니다. 방법 설명 장단점 홀드아웃(Holdout) 훈련/테스트를 한 번 분리 (보통 7:3, 8:2) 빠르지만 분할에 따라 편차 큼 k-fold CV 데이터를 k개 폴드로 나눠 k번 반복 안정적, k=5/10이 일반적 LOOCV n개 데이터에 대해 n번 검증 (k=n) 편향↓, 계산 비용↑↑ 층화 k-fold(Stratified) 폴드마다 클래스 비율 유지 불균형 데이터에 필수 부트스트랩(Bootstrap) 복원추출로 훈련 세트 구성, OOB로 검증 OOB ≈ 36.8% 자동 …</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>R 프로그래밍 기초</title>
      <link>https://adsp.todaycode.kr/study/35</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/35</guid>
      <pubDate>Wed, 30 Sep 2026 00:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>빅데이터 3V/5V</category>
      <category>회귀분석</category>
      <category>시계열 분석</category>
      <category>군집분석</category>
      <category>R 프로그래밍</category>
      <category>데이터 전처리</category>
      <description>R 언어 특징 R은 통계 분석과 시각화에 특화된 오픈소스 프로그래밍 언어입니다. - 벡터화 연산: 반복문 없이 벡터 단위로 연산 수행 - 오픈소스: CRAN에서 15,000개 이상의 패키지 제공 - 통계/시각화 특화: 회귀분석, 군집분석, 시계열 분석 등 내장 기본 데이터 타입 타입 설명 예시 벡터(Vector) 동일 타입 원소의 1차원 집합 c(1, 2, 3) 행렬(Matrix) 동일 타입의 2차원 구조 matrix(1:6, nrow=2) 데이터프레임(Data Frame) 열마다 다른 타입 허용, 표 형태 data.frame() 리스트(List) 서로 다른 타입 원소 허용 list(1, &quot;a&quot;, TRUE) 팩터(Factor) 범주형 변수, 레벨 보유 factor(c(&quot;남&quot;,&quot;여&quot;)) 주요 패키지 - ggplot2: 그래머 오브 그래픽스 기반 시각화 - dplyr: 데이터 조작 및 변환 - tidyr: 데이터 구조 정리(wide↔long 변환) - caret: 머신러닝 모델 학습/평…</description>
      <content:encoded><![CDATA[<p>R 언어 특징 R은 통계 분석과 시각화에 특화된 오픈소스 프로그래밍 언어입니다. - 벡터화 연산: 반복문 없이 벡터 단위로 연산 수행 - 오픈소스: CRAN에서 15,000개 이상의 패키지 제공 - 통계/시각화 특화: 회귀분석, 군집분석, 시계열 분석 등 내장 기본 데이터 타입 타입 설명 예시 벡터(Vector) 동일 타입 원소의 1차원 집합 c(1, 2, 3) 행렬(Matrix) 동일 타입의 2차원 구조 matrix(1:6, nrow=2) 데이터프레임(Data Frame) 열마다 다른 타입 허용, 표 형태 data.frame() 리스트(List) 서로 다른 타입 원소 허용 list(1, "a", TRUE) 팩터(Factor) 범주형 변수, 레벨 보유 factor(c("남","여")) 주요 패키지 - ggplot2: 그래머 오브 그래픽스 기반 시각화 - dplyr: 데이터 조작 및 변환 - tidyr: 데이터 구조 정리(wide↔long 변환) - caret: 머신러닝 모델 학습/평가 통합 기본 문법 - 변수 할당: x <- 10 (화살표 연산자) - 파이프 연산자: %% (magrittr/dplyr), 왼쪽 결과를 오른쪽 함수의 첫 인자로 전달 - dplyr 주요 함수: filter() 행 필터링, select() 열 선택, mutate() 변수 생성, groupby() 그룹화, summarise() 집계 R 기본 자료형 (Atomic Types) 자료형 설명 예시 numeric 정수·실수 1, 3.14 integer 정수 (L 접미사) 5L character 문자열 "ADsP" logical 논리형 TRUE, FALSE complex 복소수 1+2i 결측값(Missing Value) 4종류 표현 의미 발생 예 NA Not Available, 결측값 응답 누락 NULL 객체 자체가 없음 빈 리스트 원소 NaN Not a Number, 정의 불가 0/0, log(-1) Inf / -Inf 양·음 무한대 1/0 결측 검사: is.na(), is.null(), is.nan(), is.infinite(). NA는 is.na()=TRUE이지만 NaN도 is.na()=TRUE임에 주의. apply 계열 함수 (반복문 대체) 함수 입력 출력 용도 apply(X, MARGIN, FUN) 행렬/배열 벡터/행렬 행(1)·열(2) 단위 적용 sapply(X, FUN) 벡터/리스트 벡터/행렬 (단순화) 각 원소에 함수 적용 lapply(X, FUN) 벡터/리스트 리스트 결과를 리스트로 보존 mapply(FUN, ...) 다중 인자 벡터/행렬 sapply의 다변수 버전 tapply(X, INDEX, FUN) 벡터+그룹 그룹별 집계 groupby + summarise 시험 포인트: apply(m, 1, sum) = 행 합계, apply(m, 2, sum) = 열 합계. 결과 자료구조 차이(sapply=벡터, lapply=리스트)가 자주 출제됩니다. apply 함수 계열 - apply(X, MARGIN, FUN): 행렬·배열에 함수 적용. MARGIN=1 행, 2 열 - sapply(X, FUN): 리스트·벡터에 적용, 가능하면 벡터·행렬로 단순화 반환 - lapply(X, FUN): 리스트로 반환 - vapply(X, FUN, FUN.VALUE): sapply에 반환형 명시 — 더 안전 - mapply(FUN, ...): 다중 인자 sapply - tapply(X, INDEX, FUN): 그룹별 함수 적용 자료구조와 변환 - vector / list / matrix / array / data.frame / factor: R의 6대 자료형 - array: 다차원 배열 — array(data, dim=c(...)) - factor: 범주형 변수 — 수준(levels) 관리 - cbind / rbind: 열·행 결합 - merge: 데이터프레임 조인 (by 기준) - subset: 조건으로 부분 추출 dplyr 핵심 동사 - filter(): 행 선택, select(): 열 선택 - mutate(): 새 변수 생성, summarise(): 요…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터마트와 데이터 전처리</title>
      <link>https://adsp.todaycode.kr/study/36</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/36</guid>
      <pubDate>Tue, 29 Sep 2026 23:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>기억 용량 단위</category>
      <category>빅데이터</category>
      <category>기술통계</category>
      <category>시계열 분석</category>
      <category>인공신경망</category>
      <category>R 프로그래밍</category>
      <category>데이터 전처리</category>
      <category>탐색적 분석</category>
      <category>데이터 마트</category>
      <category>이상치·결측</category>
      <category>데이터 웨어하우스</category>
      <category>SQL</category>
      <description>데이터마트 정의 데이터마트(Data Mart)는 특정 분석 목적에 맞게 가공·정제된 데이터 집합입니다. 데이터 웨어하우스(전사 통합)와 달리 부서·주제별로 분리된 소규모 데이터 저장소입니다. 구분 데이터마트 데이터 웨어하우스 범위 부서/주제 단위 전사 통합 크기 소규모 (GB) 대규모 (TBPB) 목적 특정 분석 통합 리포팅 데이터 전처리 단계 1. 결측값 처리: 누락 데이터 처리 2. 이상값 처리: 비정상적인 값 탐지 및 처리 3. 정규화/표준화: 변수 스케일 통일 4. 변수 변환: 파생변수 생성, 인코딩 결측값 처리 방법 - 완전 제거(Listwise Deletion): 결측 행 전체 삭제 - 평균/중앙값 대체: 연속형 변수에 평균·중앙값 삽입 - 회귀 대체: 다른 변수로 결측값 예측 - 다중 대체(Multiple Imputation): 여러 번 대체 후 결과 통합 이상값 탐지 - IQR 기준: Q1-1.5×IQR 미만, Q3+1.5×IQR 초과 - Z-score: Z 3이면 이…</description>
      <content:encoded><![CDATA[<p>데이터마트 정의 데이터마트(Data Mart)는 특정 분석 목적에 맞게 가공·정제된 데이터 집합입니다. 데이터 웨어하우스(전사 통합)와 달리 부서·주제별로 분리된 소규모 데이터 저장소입니다. 구분 데이터마트 데이터 웨어하우스 범위 부서/주제 단위 전사 통합 크기 소규모 (GB) 대규모 (TBPB) 목적 특정 분석 통합 리포팅 데이터 전처리 단계 1. 결측값 처리: 누락 데이터 처리 2. 이상값 처리: 비정상적인 값 탐지 및 처리 3. 정규화/표준화: 변수 스케일 통일 4. 변수 변환: 파생변수 생성, 인코딩 결측값 처리 방법 - 완전 제거(Listwise Deletion): 결측 행 전체 삭제 - 평균/중앙값 대체: 연속형 변수에 평균·중앙값 삽입 - 회귀 대체: 다른 변수로 결측값 예측 - 다중 대체(Multiple Imputation): 여러 번 대체 후 결과 통합 이상값 탐지 - IQR 기준: Q1-1.5×IQR 미만, Q3+1.5×IQR 초과 - Z-score: Z 3이면 이상값 - Boxplot: 수염(whisker) 범위 벗어난 점 정규화 - Min-Max 정규화: (x - min) / (max - min) → [0, 1] 범위 - Z-score 표준화: (x - μ) / σ → 평균 0, 표준편차 1 파생변수: 기존 변수를 조합·변환하여 새롭게 생성한 변수 (예: 나이 → 연령대) EDW(Enterprise Data Warehouse) vs 데이터마트(DM) 구분 EDW DM 범위 전사 통합 (모든 부서/시스템) 부서·주제별 부분 크기 TB PB GB 단위 사용자 경영진, 분석가 특정 부서·팀 구축 장기·고비용 단기·저비용 데이터 모델 정규화/스타 스키마 비정규화/스타 스키마 ETL vs ELT - ETL: 추출(Extract) → 변환(Transform) → 적재(Load), 전통적 DW - ELT: 추출 → 적재 → 변환, 클라우드/빅데이터 환경 DW 스키마 종류 스키마 특징 스타 스키마(Star) 중앙 팩트 테이블 + 비정규화된 차원 테이블 스노우플레이크(Snowflake) 차원 테이블이 정규화되어 분기 팩트 콘스텔레이션 여러 팩트 테이블을 차원으로 연결 데이터 변환 — reshape &amp; JOIN reshape - wide → long(melt): 여러 열을 행으로 펼침 - long → wide(cast/dcast): 행을 열로 모음 - R: reshape2::melt/dcast, tidyr::pivotlonger/pivotwider JOIN 4종 (분석에 자주 사용) JOIN 결과 INNER JOIN 양쪽 모두에 매칭되는 행 LEFT JOIN 왼쪽 테이블 전체 + 오른쪽 매칭 RIGHT JOIN 오른쪽 전체 + 왼쪽 매칭 FULL OUTER JOIN 양쪽 모두 (매칭 + 미매칭) 시험 포인트: EDW는 전사 통합, DM은 부서별. 데이터마트는 EDW의 부분집합으로 볼 수 있음. 결측값 발생 메커니즘 — MCAR/MAR/MNAR 메커니즘 영문 설명 처리 MCAR Missing Completely At Random 결측이 완전 무작위 (다른 변수와 무관) 단순 제거·평균 대체로 충분 MAR Missing At Random 다른 관측된 변수에 의존 (예: 남성이 체중 응답 회피) 회귀 대체, 다중 대체 MNAR Missing Not At Random 결측값 자체에 의존 (예: 고소득자의 소득 미응답) 모델링 어려움, 도메인 전문 지식 시험 포인트: MCAR는 무조건 무작위, MAR는 다른 관측 변수에 의존, MNAR는 결측값 자체에 의존. 머신러닝 기반 이상치 탐지 기법 원리 특징 Isolation Forest 랜덤 분할로 데이터 격리, 평균 분리 깊이 사용 이상치는 적은 분할로 격리됨 LOF (Local Outlier Factor) 지역 밀도 비교 주변보다 밀도 낮으면 이상치 One-Class SVM 정상 데이터 경계 학습 경계 밖 = 이상치 DBSCAN 밀도 기반 군집의 노이즈 군집에 속하지 않는 점이 이상치 Autoencoder 재구성 오차 큰 점 신경망 기반 통계 vs ML 기반 비교 - 통계…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>텍스트 마이닝</title>
      <link>https://adsp.todaycode.kr/study/37</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/37</guid>
      <pubDate>Tue, 29 Sep 2026 22:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>인공신경망</category>
      <category>데이터 전처리</category>
      <category>판별분석</category>
      <category>텍스트 마이닝</category>
      <description>텍스트 마이닝 정의 텍스트 마이닝(Text Mining)은 비정형 텍스트 데이터에서 유용한 정보와 패턴을 추출하는 기술입니다. 전처리 단계 1. 토크나이징(Tokenizing): 텍스트를 단어/문장 단위로 분리 2. 불용어 제거(Stopword Removal): &apos;은/는/이/가&apos; 등 의미 없는 단어 제거 3. 어간 추출(Stemming): 단어를 기본형으로 변환 4. 품사 태깅(POS Tagging): 명사·동사·형용사 등 품사 분류 5. 형태소 분석: 한국어 처리의 핵심, 단어를 형태소 단위로 분리 주요 기법 기법 설명 TF-IDF 단어 빈도(TF) × 역문서 빈도(IDF) — 문서 내 핵심 단어 추출 LDA Latent Dirichlet Allocation — 잠재 토픽 모델링 감성 분석 텍스트의 긍정/부정/중립 감성 분류 워드클라우드 단어 빈도에 비례한 크기로 시각화 TF-IDF 개념 - TF(Term Frequency): 특정 문서 내 단어 등장 횟수 - IDF(Inverse…</description>
      <content:encoded><![CDATA[<p>텍스트 마이닝 정의 텍스트 마이닝(Text Mining)은 비정형 텍스트 데이터에서 유용한 정보와 패턴을 추출하는 기술입니다. 전처리 단계 1. 토크나이징(Tokenizing): 텍스트를 단어/문장 단위로 분리 2. 불용어 제거(Stopword Removal): '은/는/이/가' 등 의미 없는 단어 제거 3. 어간 추출(Stemming): 단어를 기본형으로 변환 4. 품사 태깅(POS Tagging): 명사·동사·형용사 등 품사 분류 5. 형태소 분석: 한국어 처리의 핵심, 단어를 형태소 단위로 분리 주요 기법 기법 설명 TF-IDF 단어 빈도(TF) × 역문서 빈도(IDF) — 문서 내 핵심 단어 추출 LDA Latent Dirichlet Allocation — 잠재 토픽 모델링 감성 분석 텍스트의 긍정/부정/중립 감성 분류 워드클라우드 단어 빈도에 비례한 크기로 시각화 TF-IDF 개념 - TF(Term Frequency): 특정 문서 내 단어 등장 횟수 - IDF(Inverse Document Frequency): 전체 문서 중 해당 단어가 등장하는 문서의 역수(log 적용) - TF-IDF: 해당 문서에는 자주 나오지만 다른 문서에는 드문 단어를 핵심 키워드로 판별 활용 사례 - SNS 여론 분석, 고객 리뷰 감성 분석, 뉴스 토픽 분류, 챗봇 인텐트 분류 워드 임베딩 (Word Embedding) 단어를 저차원 실수 벡터로 표현하여 의미적 유사성을 포착. 기법 등장 특징 Word2Vec (2013, Google) 신경망 기반 CBOW(주변→중심), Skip-gram(중심→주변) GloVe (2014, Stanford) 전역 통계 + 로컬 컨텍스트 동시발생 행렬 분해 FastText (2016, Facebook) 부분 단어(subword) 활용 미등록 단어(OOV) 강건, 형태론 풍부 언어 적합 BERT (2018, Google) Transformer 기반 양방향 문맥 의존 임베딩, 사전학습 모델 Word2Vec의 마법 - king - man + woman ≈ queen - Paris - France + Italy ≈ Rome - 단어 의미를 벡터 공간의 방향으로 표현 전통 기법 vs 워드임베딩 기법 차원 의미 포착 BoW (Bag of Words) 어휘 크기 (수만수십만) 단순 빈도 TF-IDF 어휘 크기 문서 내 중요도 Word2Vec/GloVe 100300 (저차원) 의미적 유사성 BERT (문맥 임베딩) 7681024 문맥 의존 의미 LDA vs BERT (텍스트 모델링) - LDA (Latent Dirichlet Allocation): 토픽 모델링, 문서별 토픽 분포 - BERT: 문맥 임베딩, 분류·NER·QA 다목적 시험 포인트: Word2Vec의 두 모델(CBOW, Skip-gram), 임베딩의 핵심은 "의미적 유사성을 벡터 거리로". BERT는 사전학습+미세조정 패러다임. 추가 핵심 개념 — 토큰화·임베딩·정규화 - 토큰화(Tokenization): 텍스트를 의미 단위(단어·서브워드·문자)로 분할. 영어는 공백 기준, 한국어는 형태소 분석 필수. - 형태소 분석(Morphological Analysis): 한국어는 교착어로 어미·조사가 발달해 단어를 의미의 최소 단위(형태소)로 분리하고 품사(POS)를 태깅. 도구: KoNLPy(Mecab·Kkma·Komoran·Hannanum·Okt). - 표제어 추출(Lemmatization): 'studies', 'studying' → 'study' 사전 형태로 환원. 정확하지만 느림. - 스테밍(Stemming): 어미 제거로 어간 추출. 규칙 기반(Porter Stemmer)으로 빠르나 결과가 사전 단어가 아닐 수 있음. - TF-IDF: TF(문서 내 빈도) × IDF(log(전체 문서 수 / 단어 등장 문서 수)). 흔한 단어(the·이다) 가중치↓, 특정 문서 핵심어 가중치↑. - Word2Vec / BERT / GPT: 단어·문장을 밀집 벡터로 임베딩하는 신경망. 의미·문맥 표현. BERT는 양방향 Transformer 인코더, GPT는 단방…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>사회연결망 분석 (SNA)</title>
      <link>https://adsp.todaycode.kr/study/38</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/38</guid>
      <pubDate>Tue, 29 Sep 2026 21:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>군집분석</category>
      <category>사회연결망 분석</category>
      <category>추천 시스템</category>
      <description>SNA 정의 사회연결망 분석(Social Network Analysis, SNA)은 개인·조직 간의 관계를 그래프 구조로 표현하고 분석하는 기법입니다. 네트워크 기본 구성 - 노드(Node/Vertex): 개인, 조직 등 분석 단위 - 엣지(Edge/Link): 노드 간의 관계 (방향성 유/무) - 밀도(Density): 실제 연결 수 / 가능한 최대 연결 수 - 클러스터(Cluster): 밀집하게 연결된 노드 집합 중심성(Centrality) 지표 지표 설명 의미 연결정도 중심성 (Degree) 직접 연결된 노드 수 많은 관계를 맺은 허브 근접 중심성 (Closeness) 다른 모든 노드까지의 평균 거리 역수 정보 전달 속도 매개 중심성 (Betweenness) 다른 노드 쌍의 최단 경로에 위치하는 빈도 정보 흐름의 병목 위세 중심성 (Eigenvector) 연결된 노드의 중요도까지 반영 영향력 있는 노드와의 연결 응용 분야 - SNS 영향력 분석: 핵심 인플루언서 식별 - 조직 …</description>
      <content:encoded><![CDATA[<p>SNA 정의 사회연결망 분석(Social Network Analysis, SNA)은 개인·조직 간의 관계를 그래프 구조로 표현하고 분석하는 기법입니다. 네트워크 기본 구성 - 노드(Node/Vertex): 개인, 조직 등 분석 단위 - 엣지(Edge/Link): 노드 간의 관계 (방향성 유/무) - 밀도(Density): 실제 연결 수 / 가능한 최대 연결 수 - 클러스터(Cluster): 밀집하게 연결된 노드 집합 중심성(Centrality) 지표 지표 설명 의미 연결정도 중심성 (Degree) 직접 연결된 노드 수 많은 관계를 맺은 허브 근접 중심성 (Closeness) 다른 모든 노드까지의 평균 거리 역수 정보 전달 속도 매개 중심성 (Betweenness) 다른 노드 쌍의 최단 경로에 위치하는 빈도 정보 흐름의 병목 위세 중심성 (Eigenvector) 연결된 노드의 중요도까지 반영 영향력 있는 노드와의 연결 응용 분야 - SNS 영향력 분석: 핵심 인플루언서 식별 - 조직 관계 분석: 비공식 리더 발굴 - 추천 시스템: 협업 필터링의 기반 - 전염병 확산 모델링: 감염 경로 추적 중심성(Centrality) 종류 - 연결 중심성(Degree Centrality): 직접 연결된 노드 수 — 가장 단순 - 근접 중심성(Closeness Centrality): 다른 모든 노드까지 거리의 역수 — 정보 확산 속도 - 매개 중심성(Betweenness Centrality): 다른 노드 쌍의 최단 경로에 등장하는 빈도 — 정보 흐름 통제력(브로커) - 고유벡터 중심성(Eigenvector Centrality): 중요한 노드와 연결될수록 자신도 중요 — 영향력 - PageRank: 고유벡터 중심성을 일반화한 알고리즘 — 구글 검색의 기초 네트워크 구조 지표 - 밀도(Density): 실제 연결 수 / 가능한 최대 연결 수 — 그래프가 얼마나 빽빽한지 - 응집력(Cohesion): 노드 간 연결의 강도와 군집 형성 정도 - 구조적 등위성(Structural Equivalence): 동일한 이웃 패턴을 가진 노드들 — 역할 분석에 사용 - 클러스터링 계수(Clustering Coefficient): 이웃끼리 서로 연결된 비율 그래프 기본 용어 - 노드(Node, Vertex): 그래프의 점 — 사람·문서·도시 등 개체 - 엣지(Edge, Link): 노드 사이의 연결선 — 관계·상호작용 - 방향 그래프(Directed Graph): 화살표가 있는 그래프 (트위터 팔로우) - 무방향 그래프(Undirected Graph): 화살표 없음 (페이스북 친구) - 가중치(Weight): 엣지의 강도 (대화 횟수·거리) - 이웃(Neighbor): 특정 노드와 직접 연결된 노드들 네트워크 범위 - 전체 네트워크(Whole Network): 모든 노드와 관계를 포함 - 자아 네트워크(Ego Network): 한 노드(자아, ego)와 그 직접 이웃·이웃 간 관계 SNA 추가 구조 지표 - K-core: 모든 노드가 최소 k개의 연결을 갖는 부분그래프 - 약한 연결(Weak Tie): 자주 만나지 않지만 다른 집단을 연결 — 정보 다양성에 중요 (Granovetter) - 강한 연결(Strong Tie): 자주·깊게 상호작용 - 구조적 공백(Structural Hole): 두 그룹 사이의 단절 — 이 자리를 메우는 노드(Broker)는 큰 정보·자원 통제력 - Triadic Closure(삼각 폐쇄): A-B와 A-C가 연결되어 있으면 B-C도 연결될 가능성 ↑ — 군집 형성 원리 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 근접 중심성 — 다른 모든 노드까지 거리의 역수 — 정보 확산 속도 - 매개 중심성 — 다른 노드 쌍의 최단 경로에 등장하는 빈도 — 정보 흐름 통제력(브로커) - 고유벡터 중심성 — 중요한 노드와 연결될수록 자신도 중요 — 영향력 - PageRank — 고유벡터 중심성을 일반화한 알고리즘 — 구글 검색의 기초 - 응집력 — 노드 간 연결의 강도와 군집 형성 정도 - 구조적 등위성…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>빅데이터 비즈니스 모델</title>
      <link>https://adsp.todaycode.kr/study/46</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/46</guid>
      <pubDate>Tue, 29 Sep 2026 20:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>빅데이터</category>
      <category>빅데이터 활용</category>
      <category>분석 주제 유형</category>
      <category>데이터 기반 의사결정</category>
      <category>IoT·플랫폼</category>
      <description>빅데이터 비즈니스 모델 정의 빅데이터 비즈니스 모델이란 빅데이터를 수집·분석·활용하여 수익을 창출하거나 기업 가치를 높이는 사업 방식입니다. ADsP 시험에서는 모델 유형 구분과 대표 사례 매핑이 핵심 출제 포인트입니다. 빅데이터 활용 수익 창출 유형 유형 설명 사례 데이터 판매 모델 보유 데이터를 직접 판매 또는 자산화 신용평가사 CB 데이터 판매 광고 기반 모델 데이터 분석으로 타깃 광고 수익 창출 구글, 페이스북(Meta) 플랫폼 비즈니스 모델 네트워크 효과를 활용한 생태계 구축 카카오, 네이버 빅데이터 서비스 제공 모델 분석 인프라·서비스를 판매 AWS, Google Cloud, Azure 데이터 기반 의사결정 모델 내부 데이터 분석으로 비용 절감·최적화 넷플릭스 추천, 아마존 물류 최적화 정보 판매 모델 (Information Selling) - 구글: 검색 행동 데이터 → 맞춤형 광고 수익 - 페이스북: SNS 활동 데이터 → 타깃 마케팅 플랫폼 - 핵심: 사용자에게는 무…</description>
      <content:encoded><![CDATA[<p>빅데이터 비즈니스 모델 정의 빅데이터 비즈니스 모델이란 빅데이터를 수집·분석·활용하여 수익을 창출하거나 기업 가치를 높이는 사업 방식입니다. ADsP 시험에서는 모델 유형 구분과 대표 사례 매핑이 핵심 출제 포인트입니다. 빅데이터 활용 수익 창출 유형 유형 설명 사례 데이터 판매 모델 보유 데이터를 직접 판매 또는 자산화 신용평가사 CB 데이터 판매 광고 기반 모델 데이터 분석으로 타깃 광고 수익 창출 구글, 페이스북(Meta) 플랫폼 비즈니스 모델 네트워크 효과를 활용한 생태계 구축 카카오, 네이버 빅데이터 서비스 제공 모델 분석 인프라·서비스를 판매 AWS, Google Cloud, Azure 데이터 기반 의사결정 모델 내부 데이터 분석으로 비용 절감·최적화 넷플릭스 추천, 아마존 물류 최적화 정보 판매 모델 (Information Selling) - 구글: 검색 행동 데이터 → 맞춤형 광고 수익 - 페이스북: SNS 활동 데이터 → 타깃 마케팅 플랫폼 - 핵심: 사용자에게는 무료 서비스, 광고주에게 데이터 기반 광고 판매 플랫폼 비즈니스 모델 - 네트워크 효과: 이용자가 많을수록 플랫폼 가치 증가 - 양면 시장(Two-sided Market): 소비자와 공급자를 연결 - 데이터 축적 → 추천·맞춤화 → 이용자 증가의 선순환 구조 빅데이터 3대 혁신 혁신 영문 내용 화폐화 Monetization 데이터를 수익으로 전환 개인화 Personalization 개인별 맞춤 서비스 제공 지능화 Intelligence AI·분석 기반 자동화·최적화 시험 핵심: 빅데이터 비즈니스 모델 유형(정보 판매, 플랫폼, 서비스 제공, 의사결정)과 대표 사례를 정확히 매핑하세요. 빅데이터 3대 혁신(화폐화·개인화·지능화)도 자주 출제됩니다.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>미래의 빅데이터와 데이터 사이언스</title>
      <link>https://adsp.todaycode.kr/study/47</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/47</guid>
      <pubDate>Tue, 29 Sep 2026 19:29:04 GMT</pubDate>
      <category>1과목 데이터 이해</category>
      <category>빅데이터</category>
      <category>데이터 사이언스</category>
      <category>개인정보</category>
      <category>빅데이터 가치</category>
      <category>데이터 거버넌스</category>
      <category>기술통계</category>
      <category>모형 평가</category>
      <category>IoT·플랫폼</category>
      <description>빅데이터 미래 발전 방향 빅데이터는 단순 대용량 처리에서 벗어나 초개인화, 실시간 처리, AI 융합 방향으로 발전하고 있습니다. 트렌드 설명 초개인화 개인 맥락·행동 패턴 기반 1:1 맞춤 서비스 실시간 처리 스트리밍 데이터를 즉시 분석·대응 AI 융합 머신러닝·딥러닝과 빅데이터 결합 엣지 컴퓨팅 데이터 생성 지점(엣지)에서 처리, 지연 최소화 5G·IoT 융합 초연결 환경에서 폭발적 데이터 증가 디지털 트윈 현실 세계를 가상으로 복제하여 시뮬레이션 데이터 이코노미 (Data Economy) - 데이터 이코노미: 데이터가 석유처럼 경제적 자산으로 거래되는 시대 - 데이터 브로커, 데이터 마켓플레이스 등장 - 개인 데이터 주권(Data Sovereignty) 논의 활성화 데이터 자원의 경제적 특성 특성 설명 비경합성 (Non-rival) 한 사람이 사용해도 다른 사람의 사용이 줄지 않음 비배제성 데이터 공유 시 제3자 배제가 어려움 네트워크 효과 데이터가 많을수록 가치 증가 규모의 경…</description>
      <content:encoded><![CDATA[<p>빅데이터 미래 발전 방향 빅데이터는 단순 대용량 처리에서 벗어나 초개인화, 실시간 처리, AI 융합 방향으로 발전하고 있습니다. 트렌드 설명 초개인화 개인 맥락·행동 패턴 기반 1:1 맞춤 서비스 실시간 처리 스트리밍 데이터를 즉시 분석·대응 AI 융합 머신러닝·딥러닝과 빅데이터 결합 엣지 컴퓨팅 데이터 생성 지점(엣지)에서 처리, 지연 최소화 5G·IoT 융합 초연결 환경에서 폭발적 데이터 증가 디지털 트윈 현실 세계를 가상으로 복제하여 시뮬레이션 데이터 이코노미 (Data Economy) - 데이터 이코노미: 데이터가 석유처럼 경제적 자산으로 거래되는 시대 - 데이터 브로커, 데이터 마켓플레이스 등장 - 개인 데이터 주권(Data Sovereignty) 논의 활성화 데이터 자원의 경제적 특성 특성 설명 비경합성 (Non-rival) 한 사람이 사용해도 다른 사람의 사용이 줄지 않음 비배제성 데이터 공유 시 제3자 배제가 어려움 네트워크 효과 데이터가 많을수록 가치 증가 규모의 경제 데이터 규모가 커질수록 분석 정확도 향상 데이터 사이언스의 미래 기술 - AutoML: 모델 선택·하이퍼파라미터 튜닝 자동화, 비전문가도 ML 활용 가능 - 설명 가능한 AI (XAI, eXplainable AI): 블랙박스 AI의 의사결정 과정을 인간이 이해할 수 있도록 설명 - 연합학습 (Federated Learning): 데이터를 중앙 서버에 모으지 않고 분산된 기기에서 모델 학습 → 개인정보 보호 실현 데이터 윤리와 AI 거버넌스 - 데이터 윤리: 개인정보 보호, 알고리즘 편향 방지, 투명성 확보 - AI 거버넌스: AI 시스템의 책임·공정성·안전성을 관리하는 체계 - GDPR(유럽 일반 데이터 보호 규정): 개인 데이터 처리에 관한 핵심 규제 사례 시험 핵심: 데이터 자원의 비경합성(non-rival)은 일반 재화와 구별되는 핵심 특성입니다. 연합학습(Federated Learning)은 개인정보 보호를 위한 분산 학습 방식임을 기억하세요. 추가 핵심 개념 — MLOps와 모델 운영 - MLOps(Machine Learning Operations): ML 모형의 개발·배포·모니터링·재학습을 자동화하는 방법론·도구. DevOps + ML. - 모델 드리프트(Model Drift): 배포된 모형의 성능이 시간 경과로 저하되는 현상. - 데이터 드리프트(Data Drift): 입력 분포 변화 - 컨셉 드리프트(Concept Drift): 입력-출력 관계 변화 - 라벨 드리프트(Label Drift): 라벨 분포 변화 - A/B 테스트: 서로 다른 모델/UI를 실제 사용자 집단에 동시에 적용해 성능을 통계적으로 비교. - MLOps 도구: MLflow, Kubeflow, AWS SageMaker, GCP Vertex AI, Tecton(피처 스토어), Evidently(드리프트 탐지). - 추천 시스템 — 내용 기반 vs 협업 필터링: - 내용 기반(Content-Based): 아이템 속성·태그와 사용자 선호 프로필 매칭. 콜드스타트 사용자에 강함 - 협업 필터링(Collaborative Filtering): 비슷한 사용자/아이템의 행동 패턴 활용. SVD·NMF·딥러닝(NCF) - 하이브리드: 두 방식 결합 - 강화학습(Reinforcement Learning): 에이전트가 환경과 상호작용하며 보상(Reward)을 최대화하는 정책(Policy) 학습. AlphaGo·자율주행·게임 AI. 시험 핵심: 모델 드리프트 3종, 추천 시스템의 콘텐츠 기반 vs 협업 필터링, 지도/비지도/강화학습 3분류가 미래 빅데이터 단원의 출제 포인트입니다. 데이터 윤리와 책임 - 데이터 윤리(Data Ethics): 수집·분석·활용 전반에서 개인의 권리·공정성·투명성·책임을 고려하는 원칙 - 책임 있는 AI(Responsible AI): 공정성·설명가능성·견고성·프라이버시·책임성을 충족하는 AI 개발 원칙 - 알고리즘 책무성(Accountability): 알고리즘 결정의 결과에 대한 설명과 책임 - 모델 거버넌스: 학습 데이터·모델·예측 결과의 추적…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>데이터 마이닝 개요</title>
      <link>https://adsp.todaycode.kr/study/48</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/48</guid>
      <pubDate>Tue, 29 Sep 2026 18:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>데이터베이스</category>
      <category>분석 주제 유형</category>
      <category>분석 방법론</category>
      <category>KDD</category>
      <category>CRISP-DM</category>
      <category>SEMMA</category>
      <category>회귀분석</category>
      <category>로지스틱 회귀</category>
      <category>시계열 분석</category>
      <category>의사결정나무</category>
      <category>인공신경망</category>
      <category>군집분석</category>
      <category>연관분석</category>
      <category>차원 축소</category>
      <category>과적합</category>
      <category>데이터 전처리</category>
      <category>탐색적 분석</category>
      <category>데이터 마이닝</category>
      <category>데이터 마트</category>
      <category>이상치·결측</category>
      <category>MLOps·최신 ML</category>
      <description>데이터 마이닝 정의 데이터 마이닝(Data Mining)은 대규모 데이터에서 통계·기계학습 기법을 활용하여 유용한 패턴과 지식을 자동으로 발견하는 과정입니다. KDD 프로세스 (Knowledge Discovery in Databases) 대용량 데이터베이스에서 지식을 발견하는 5단계 프로세스입니다. 단계 명칭 설명 1 데이터 선택 (Selection) 분석 목적에 맞는 데이터 추출 2 전처리 (Preprocessing) 결측치 처리, 이상값 제거, 노이즈 정제 3 변환 (Transformation) 정규화, 차원 축소, 특징 추출 4 데이터 마이닝 (Data Mining) 알고리즘 적용, 패턴·규칙 탐색 5 해석 및 평가 (Interpretation/Evaluation) 발견된 패턴의 의미 해석 및 유용성 평가 CRISP-DM 방법론 (6단계) 산업 표준 데이터 마이닝 방법론입니다. 1. 비즈니스 이해 (Business Understanding): 목표 정의 2. 데이터 이해 (Da…</description>
      <content:encoded><![CDATA[<p>데이터 마이닝 정의 데이터 마이닝(Data Mining)은 대규모 데이터에서 통계·기계학습 기법을 활용하여 유용한 패턴과 지식을 자동으로 발견하는 과정입니다. KDD 프로세스 (Knowledge Discovery in Databases) 대용량 데이터베이스에서 지식을 발견하는 5단계 프로세스입니다. 단계 명칭 설명 1 데이터 선택 (Selection) 분석 목적에 맞는 데이터 추출 2 전처리 (Preprocessing) 결측치 처리, 이상값 제거, 노이즈 정제 3 변환 (Transformation) 정규화, 차원 축소, 특징 추출 4 데이터 마이닝 (Data Mining) 알고리즘 적용, 패턴·규칙 탐색 5 해석 및 평가 (Interpretation/Evaluation) 발견된 패턴의 의미 해석 및 유용성 평가 CRISP-DM 방법론 (6단계) 산업 표준 데이터 마이닝 방법론입니다. 1. 비즈니스 이해 (Business Understanding): 목표 정의 2. 데이터 이해 (Data Understanding): 데이터 탐색 3. 데이터 준비 (Data Preparation): 전처리·변환 4. 모델링 (Modeling): 알고리즘 적용 5. 평가 (Evaluation): 비즈니스 목표 부합 여부 검토 6. 배포 (Deployment): 실제 환경 적용 SEMMA 방법론 (SAS) SAS Institute가 개발한 5단계 방법론입니다. 단계 설명 Sample 대표 샘플 추출 Explore 탐색적 분석, 패턴 파악 Modify 변수 변환, 파생변수 생성 Model 모델 적합 Assess 모델 성능 평가 데이터 마이닝 주요 기법 분류 기법 분류 (Classification) 의사결정나무, 로지스틱 회귀, 신경망, SVM 군집 (Clustering) K-means, 계층적 군집 연관 (Association) 아프리오리(Apriori) 알고리즘 예측 (Prediction) 회귀분석, 시계열 분석 데이터 분리 및 과적합 - 훈련/검증/테스트 비율: 7:3 또는 6:2:2 - 과적합(Overfitting): 훈련 데이터에 과도하게 맞춰 새 데이터에 일반화 실패 - 과소적합(Underfitting): 모델이 너무 단순하여 훈련 데이터도 제대로 학습하지 못함 시험 핵심: KDD 5단계(선택→전처리→변환→마이닝→해석), CRISP-DM 6단계, SEMMA 5단계의 순서와 각 방법론 간 비교가 자주 출제됩니다. 대표 활용 분야 - 이탈 예측(Churn Prediction): 통신·구독 서비스에서 고객 이탈 가능성 예측 → 선제적 retention 마케팅 - 이상거래 탐지(FDS, Fraud Detection System): 결제·보험 사기·계좌 이상 패턴 식별 — 불균형 데이터·실시간성 핵심 - 추천 시스템(Recommendation): 협업 필터링(사용자/아이템 기반), 콘텐츠 기반, 하이브리드 - 고객 세분화: RFM(Recency·Frequency·Monetary), 군집분석 활용 - CLV/LTV(Customer Lifetime Value): 고객 생애가치 예측 — 마케팅 ROI 산정 핵심 데이터마이닝 절차 (5단계) 1. 목적 설정(Business Understanding): 비즈니스 문제 정의·분석 목표 설정 2. 데이터 준비: 데이터 수집·정제·통합 3. 데이터 가공(전처리): 결측·이상치·변환·특성 생성 4. 데이터 마이닝 기법 적용(Modeling): 분류·군집·연관·예측 모델 학습 5. 검증(Evaluation): 성능 평가·해석·배포 SEMMA 방법론 (SAS) - Sample: 표본 추출 - Explore: 탐색 - Modify: 변환·가공 - Model: 모델링 - Assess: 평가 KDD vs CRISP-DM vs SEMMA - KDD: Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation - CRISP-DM: Business Understanding → Data Understanding → Data Pre…</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
    <item>
      <title>다변량 분석 — 판별분석과 요인분석</title>
      <link>https://adsp.todaycode.kr/study/49</link>
      <guid isPermaLink="true">https://adsp.todaycode.kr/study/49</guid>
      <pubDate>Tue, 29 Sep 2026 17:29:04 GMT</pubDate>
      <category>3과목 데이터 분석</category>
      <category>분석 방법론</category>
      <category>기술통계</category>
      <category>상관분석</category>
      <category>회귀분석</category>
      <category>시계열 분석</category>
      <category>차원 축소</category>
      <category>판별분석</category>
      <category>요인분석</category>
      <category>데이터 기반 의사결정</category>
      <category>강화학습·지도학습</category>
      <description>다변량 분석 정의 다변량 분석(Multivariate Analysis)은 2개 이상의 변수를 동시에 분석하는 통계 방법론의 총칭입니다. 판별분석 (Discriminant Analysis) 판별분석은 집단 소속이 알려진 데이터를 이용해 판별함수를 도출하고, 새로운 관측치를 해당 집단으로 분류하는 지도학습 기법입니다. 핵심 개념 - 목적: 집단을 구분하는 판별함수 도출 → 새로운 관측치 분류 - 선형 판별분석(LDA): 집단 간 분산을 최대화, 집단 내 분산을 최소화 - 사전 확률(Prior Probability): 각 집단에 속할 사전 확률 고려 - 오분류 비용(Misclassification Cost): 잘못 분류될 때의 비용 고려 판별분석 vs 회귀분석 구분 판별분석 회귀분석 종속변수 범주형 (집단) 연속형 (수치) 목적 집단 분류 값 예측 시험 포인트: &quot;집단 간 분산의 비율을 최대화&quot;, &quot;판별함수를 이용한 분류&quot; → 판별분석 요인분석 (Factor Analysis) 요인분석은 …</description>
      <content:encoded><![CDATA[<p>다변량 분석 정의 다변량 분석(Multivariate Analysis)은 2개 이상의 변수를 동시에 분석하는 통계 방법론의 총칭입니다. 판별분석 (Discriminant Analysis) 판별분석은 집단 소속이 알려진 데이터를 이용해 판별함수를 도출하고, 새로운 관측치를 해당 집단으로 분류하는 지도학습 기법입니다. 핵심 개념 - 목적: 집단을 구분하는 판별함수 도출 → 새로운 관측치 분류 - 선형 판별분석(LDA): 집단 간 분산을 최대화, 집단 내 분산을 최소화 - 사전 확률(Prior Probability): 각 집단에 속할 사전 확률 고려 - 오분류 비용(Misclassification Cost): 잘못 분류될 때의 비용 고려 판별분석 vs 회귀분석 구분 판별분석 회귀분석 종속변수 범주형 (집단) 연속형 (수치) 목적 집단 분류 값 예측 시험 포인트: "집단 간 분산의 비율을 최대화", "판별함수를 이용한 분류" → 판별분석 요인분석 (Factor Analysis) 요인분석은 다수의 변수들 사이에 존재하는 공분산 구조를 분석하여 잠재 요인(Factor)을 추출하는 기법입니다. 핵심 개념 - 목적: 여러 변수를 소수의 잠재 요인으로 축약하여 구조 파악 - 탐색적 요인분석(EFA): 요인 구조를 사전에 가정하지 않고 탐색 - 확인적 요인분석(CFA): 이론에 근거한 요인 구조를 검증 - 공통요인(Common Factor): 여러 변수에 공통으로 영향을 주는 잠재 요인 - 고유요인(Unique Factor): 특정 변수에만 영향을 주는 요인 - 요인 부하량(Factor Loading): 변수와 요인 간 상관관계의 크기 (절댓값 클수록 강한 관계) 베리맥스(Varimax) 회전 - 직교 회전(Orthogonal Rotation) 방법의 대표 - 각 요인의 부하량 분산을 최대화하여 요인 해석을 단순·명확하게 만듦 요인분석 vs 주성분분석(PCA) 비교 구분 요인분석(FA) 주성분분석(PCA) 목적 공분산 구조 설명, 잠재 요인 추출 분산 최대화, 차원 축소 방향 공통 요인 → 변수 설명 변수 → 주성분 도출 오차항 고유요인(오차) 포함 없음 정준상관분석 (Canonical Correlation) - 두 변수 집합(X군, Y군) 간의 상관관계를 최대화하는 선형 결합 도출 - 예: 학업 변수군과 취업 변수군 간의 관계 분석 다차원척도법 (MDS, Multidimensional Scaling) - 개체 간 거리(비유사성)를 측정하여 저차원 공간에 시각화 - 유사한 개체는 가깝게, 다른 개체는 멀게 배치 - 예: 소비자 브랜드 인식 지도(Perceptual Map) 작성 시험 핵심: 판별분석 = 집단 분류 목적, 집단 간 분산 최대화 / 요인분석 = 잠재 요인 추출 목적, 공분산 구조 파악 / PCA = 분산 최대화, 차원 축소. 이 3가지 차이를 명확히 구분하세요. 추가 핵심 개념 — 비지도 차원축소 비교 - t-SNE(t-Distributed Stochastic Neighbor Embedding): 고차원 데이터의 국소 이웃 구조를 보존하며 23차원에 시각화. 비선형. 군집 구조 시각화에 우수. - UMAP(Uniform Manifold Approximation and Projection): t-SNE보다 빠르고 전역 구조도 일부 보존. 차원 축소·시각화의 최신 기법. - Kernel PCA: PCA의 비선형 확장. 커널 트릭으로 고차원 공간에서 선형 PCA 수행. 시험 핵심: PCA(선형)·t-SNE(국소 비선형)·UMAP(전역+국소 비선형)·LDA(지도, 클래스 분리)의 비교가 차원축소 단원의 심화 출제 포인트입니다.</p>]]></content:encoded>
      <dc:creator>todaycode</dc:creator>
    </item>
  </channel>
</rss>
