빅데이터 활용 방법과 분석 기법

과목: 데이터 이해 (1과목, 10번 주제) ·

키워드: DBMS · 빅데이터 · 빅데이터 활용 · 분석 주제 유형 · 기술통계 · 회귀분석 · 인공신경망 · 군집분석 · 연관분석 · 차원 축소 · R 프로그래밍 · 데이터 마트 · 거리 측정 · IoT·플랫폼 · 추천 시스템 · 유전 알고리즘 · 하둡·빅데이터 인프라

정의: 빅데이터를 활용하는 대표적인 분석 기법들이 있으며, 시험에서는 각 기법의 정의와 적용 사례를 정확히 구분할 수 있는지를 묻습니다.

빅데이터를 활용하는 대표적인 분석 기법들이 있으며, 시험에서는 각 기법의 정의와 적용 사례를 정확히 구분할 수 있는지를 묻습니다. 연관규칙학습(Association Rule Learning)은 데이터 변수 간의 의미 있는 연관관계를 발견하는 분석입니다. "기저귀를 사는 고객이 맥주도 함께 산다"는 유명한 장바구니 분석이 대표적 사례입니다. "커피를 구매한 사람이 탄산음료도 구매할지 예측"하는 것도 연관분석에 해당합니다. 유형분석(Clustering)은 사용자의 특성에 맞게 그룹이나 범주로 나누어 분류하는 것으로, 고객 세분화가 대표적입니다. 유전 알고리즘(Genetic Algorithm)은 자연의 진화 과정, 즉 자연선택과 돌연변이 같은 메커니즘을 모방하여 최적의 해답을 점진적으로 찾아가는 방법입니다. "자동차 설계를 세대를 거듭하며 개선하여 연료 효율성을 극대화하는 것"이 대표적인 활용 사례입니다. 기계학습(Machine Learning)은 컴퓨터가 훈련 데이터로부터 스스로 패턴을 파악하여 새로운 데이터에 대해 예측하는 기술로, 넷플릭스의 영상 추천 시스템이 좋은 예입니다. 회귀분석(Regression)은 하나 이상의 독립변수가 종속변수에 미치는 영향을 선형 관계로 분석하는 방법으로, "기온 변화에 따른 제품 판매량 예측"처럼 수치를 예측할 때 사용합니다. 감정분석(Sentiment Analysis)은 텍스트에서 글쓴이의 감정(긍정/부정)을 분석하는 기법으로, 고객 리뷰 분석이나 소셜미디어 여론 파악에 활용됩니다. 시험에서는 각 기법과 활용 사례가 올바르게 연결되었는지를 묻는 문제가 출제됩니다. 예를 들어 "군집분석으로 자동차 설계를 최적화한다"는 유전 알고리즘의 사례이므로 잘못된 연결입니다. 핵심 요약 & 시험 포인트 분석 기법 설명 활용 예시 연관규칙학습 데이터 변수 간 연관규칙 발견 기저귀와 맥주 동시 구매 패턴 유형분석 사용자 특성에 맞게 그룹/범주 분류 고객 세분화 유전 알고리즘 자연선택·돌연변이 메커니즘으로 점진적 진화 차량 설계 최적화 기계학습 훈련 데이터에서 패턴 파악 후 예측 넷플릭스 추천 회귀분석 선형함수 기반 수치 데이터 분석 기온→판매량 예측 감정분석 텍스트에서 감정(긍정/부정) 추출 고객 리뷰 분석 시험 포인트: 유전 알고리즘은 "최적화" 문제에 사용됩니다. 연관분석은 "장바구니 분석"의 대표 사례입니다. 회귀분석은 연속형 종속변수를 예측할 때 사용합니다. 추천 시스템 (Recommendation System) 빅데이터의 가장 대표적 활용 사례. 넷플릭스·아마존·유튜브 핵심 기술. 1. 협업 필터링 (Collaborative Filtering) 사용자/항목 간 유사성 기반. 종류 원리 예시 사용자 기반(User-based) 비슷한 취향의 사용자가 좋아한 항목 추천 "비슷한 사용자가 본 영화" 아이템 기반(Item-based) 사용자가 좋아한 것과 비슷한 항목 추천 "이 책을 본 사람들이 본 다른 책" 모델 기반 행렬 분해(MF, SVD), 신경망 Netflix Prize 우승 알고리즘 2. 콘텐츠 기반 (Content-based) - 항목의 속성·태그·텍스트로 유사도 계산 - 사용자 프로파일 + 항목 프로파일 매칭 - 예: 유튜브의 동영상 메타데이터 기반 추천 3. 하이브리드 (Hybrid) - 협업 필터링 + 콘텐츠 기반 결합 - 단일 방법의 약점 보완 (Netflix, YouTube) 추천 시스템의 주요 문제 문제 설명 해결 콜드스타트(Cold Start) 새 사용자/항목 정보 없음 인기 항목, 콘텐츠 기반, 인구통계 활용 희소성(Sparsity) 평점 행렬이 대부분 비어있음 행렬 분해, 차원 축소 확장성(Scalability) 사용자·항목 수 증가 시 계산 비용↑ 분산 컴퓨팅, 근사 알고리즘 필터 버블 유사 항목만 추천되어 다양성 감소 무작위성 도입, 다양성 가중치 빅데이터 처리 단계 5단계 단계 활동 주요 도구 1. 수집(Collection) 다양한 소스에서 데이터 확보 Crawler, API, IoT, ETL 2. 저장(Storage) 분산 저장, 데이터 레이크 HDFS, S3, NoSQL (MongoDB, Cassandra) 3. 처리(Processing) 정제·변환·통합 Spark, MapReduce, Flink 4. 분석(Analysis) 통계·ML·딥러닝 R, Python, TensorFlow, scikit-learn 5. 시각화(Visualization) 결과 표현·공유 Tableau, PowerBI, ggplot, D3.js 시험 포인트: 협업 필터링 = 유사 사용자/항목, 콘텐츠 기반 = 항목 속성. 콜드스타트 문제는 신규 사용자/항목 정보 부족. Hadoop 생태계 확장 - HDFS: 분산 파일 시스템 (Hadoop Distributed File System) - YARN: 자원 관리 + 작업 스케줄링 (Yet Another Resource Negotiator) - MapReduce: 분산 일괄 처리 프레임워크 - Hive: SQL on Hadoop (HQL) - Pig: 데이터 흐름 언어(Pig Latin) — ETL에 강점 - HBase: 컬럼 기반 NoSQL — HDFS 위에서 동작 - Sqoop: RDBMS ↔ Hadoop 데이터 전송 - Flume: 로그·이벤트 데이터 수집(스트리밍) - Kafka: 분산 메시지 큐 — 실시간 스트림 파이프라인 - Spark: 인메모리 분산 처리 — MapReduce보다 100배 빠른 경우 있음 - Impala / Tez: 저지연 SQL 엔진 — Hive보다 빠른 쿼리 저장소 아키텍처 - 데이터 레이크(Data Lake): 원천 데이터를 가공 없이 저장 — Schema on Read - 데이터 웨어하우스(DW): 정제·통합된 분석용 저장소 — Schema on Write - 데이터 마트(Data Mart): 부서·주제별 소규모 DW - OLTP / OLAP: 트랜잭션 처리 / 분석 처리 - ETL / ELT: 추출·변환·적재 / 추출·적재·변환(클라우드 시대 ELT 증가) 데이터 수집 방법 - 크롤링(Crawling): 웹 페이지를 자동 순회하며 데이터 수집 — 검색 엔진의 핵심 기술 - 웹 스크래핑(Web Scraping): 특정 페이지에서 원하는 데이터만 추출 - RSS(Really Simple Syndication): 콘텐츠 변경사항을 구독 형태로 받는 XML 기반 포맷 - API 수집: 공공데이터포털·Twitter API·Open API 등 정형 인터페이스로 수집 - 로그 수집: 서버·앱·디바이스에서 발생하는 이벤트 로그 수집 (Flume·Logstash·Fluentd) - 스트리밍(Streaming) 수집: 실시간 데이터 흐름 처리 (Kafka·Kinesis·Storm) - 센서·IoT 데이터: RFID·GPS·온도·가속도 등 사물에서 생성된 데이터 머신러닝 학습 유형 - 지도학습(Supervised Learning): 입력-정답 쌍으로 학습 — 분류·회귀 - 비지도학습(Unsupervised Learning): 정답 없이 패턴 탐색 — 군집·차원축소·연관규칙 - 준지도학습(Semi-supervised Learning): 일부만 라벨된 데이터로 학습 — 라벨링 비용 절감 - 강화학습(Reinforcement Learning): 보상을 최대화하는 정책 학습 — AlphaGo·자율주행 데이터 기반 의사결정 - Data-driven Decision Making: 직관·경험이 아닌 데이터 분석 결과로 의사결정 - 비즈니스 인텔리전스(BI): 데이터 → 정보 → 인사이트로 가공해 경영 의사결정을 지원하는 체계 - 데이터 분석가 / 데이터 엔지니어 / 데이터 사이언티스트: 데이터 직무 3대 유형 분석 4단계 영역 (Gartner) - 기술 분석(Descriptive Analytics): 무슨 일이 일어났는가? — 과거 데이터 요약·집계·시각화 - 진단 분석(Diagnostic Analytics): 왜 일어났는가? — 원인 분석·드릴다운·상관 분석 - 예측 분석(Predictive Analytics): 무엇이 일어날 것인가? — 회귀·분류·시계열 모형 - 처방 분석(Prescriptive Analytics): 무엇을 해야 하는가? — 최적화·시뮬레이션·의사결정 자동화 - 분석 성숙도가 높아질수록 가치는 커지지만 복잡도·요구 데이터·기술 수준도 함께 상승 빅데이터 활용 사례 추가 - 수요 예측(Demand Forecasting): 시계열·회귀로 매출·재고·인력 수요 예측 - 이상 탐지(Anomaly Detection): 정상 패턴에서 벗어난 사건 식별 — 사기·고장·보안 위협 - 장바구니 분석(Market Basket Analysis): 함께 구매되는 상품 패턴 — 연관규칙(Apriori) 기반, 상품 진열·교차판매에 활용 - 헬스케어(Healthcare): 진단·예후 예측·이미지 판독·신약 개발에 ML/DL 활용 - 신용평가(Credit Scoring): 로지스틱 회귀·앙상블로 부도 확률 예측 - 개인화·맞춤 추천(Personalization): 사용자별 콘텐츠·상품 추천 Spark 핵심 개념 - RDD(Resilient Distributed Dataset): Spark의 기본 데이터 추상화 — 분산·불변·복원 가능한 데이터셋 - DataFrame API: SQL 친화적인 구조화 데이터 처리 인터페이스 — Catalyst 옵티마이저로 자동 최적화 - Spark의 구성: Spark Core + Spark SQL + Spark Streaming + MLlib + GraphX - YARN/Mesos/K8s 위에서 동작: 다양한 자원 관리자와 통합 MapReduce 처리 추가 - JobTracker / TaskTracker: 1세대 Hadoop의 작업 스케줄러·실행기 (YARN으로 대체) - NameNode / DataNode / Secondary NameNode: HDFS의 메타데이터·실제 데이터·메타 백업 노드 운영계 vs 분석계 - 운영계(Operational System) 데이터: 일상 업무 처리(OLTP)에서 생성·갱신되는 데이터 — 실시간 거래 - 분석계(Analytics) / 정보계(Information System) 데이터: 의사결정 지원을 위해 가공·통합·축적된 데이터 — DW·DM·OLAP - 분석용 데이터: 분석계로 옮겨져 정제·표준화된 데이터셋 - 데이터 흐름: 운영계 → ETL → DW → DM → BI/분석 빅데이터 활용 사례 추가 - 예지보전(Predictive Maintenance): 센서 데이터로 장비 고장을 사전 예측 → 다운타임·수리비 절감 - 고장 예측: 진동·온도·전류 패턴 변화를 ML로 감지 - 사용자 행동(User Behavior) 분석: 클릭·체류·전환 등 디지털 흔적으로 의도·관심 추론 → UX 개선·개인화 - 재난 예측·기상 예측: 위성·센서 데이터로 태풍·홍수·산불 위험 사전 경보 - VOC(Voice of Customer) 분석: 리뷰·고객센터 대화 분석으로 제품·서비스 개선 데이터 수집 방식 분류 - 온라인 vs 오프라인 수집: 인터넷 기반 자동 수집 vs 종이·인터뷰 등 수동 수집 - 실시간 vs 배치 수집: 발생 즉시 수집(스트리밍) vs 일정 주기 일괄 수집 빅데이터 처리 전체 흐름 - 수집(Collection) → 저장(Storage) → 처리(Processing) → 분석(Analysis) → 활용(Utilization) 5단계 - 각 단계에서 사용되는 기술이 다름: - 수집: Flume·Kafka·Sqoop·Scrapy - 저장: HDFS·S3·NoSQL - 처리: MapReduce·Spark·Tez - 분석: R·Python·Tableau - 활용: BI·대시보드·API 데이터 시장 - 데이터 거래소(Data Marketplace): 데이터를 구매·판매할 수 있는 플랫폼 — KDX 한국데이터거래소 등 - 데이터 거래(Data Trade): 데이터의 가치를 인정하고 자산처럼 매매 - 마이데이터(MyData): 정보주체가 본인 데이터의 활용 권리를 행사 빅데이터 저장 방식 - Schema-on-Write: 저장 시 스키마 정의 (전통 DW) — 정합성 좋음, 유연성 낮음 - Schema-on-Read: 읽을 때 스키마 적용 (데이터 레이크) — 원본 그대로 저장, 유연성·확장성 공급망에서의 빅데이터 - 채찍 효과(Bullwhip Effect): 수요 정보가 공급망 상류로 갈수록 변동이 증폭되는 현상 — 빅데이터·실시간 공유로 완화 새 컴퓨팅 패러다임 - 포그 컴퓨팅(Fog Computing): 클라우드와 엣지 사이 중간 계층 — 데이터를 네트워크 가장자리에서 처리 - 분산 원장(Distributed Ledger) / 블록체인(Blockchain): 데이터 무결성·신뢰의 분산 저장 기술 데이터 웨어하우스 핵심 특성 - 주제 지향성(Subject-Oriented): 비즈니스 주제별 구성 - 통합성(Integrated): 여러 원천에서 통합 - 시불변성(Time-Variant): 시계열 기록 보존 - 비휘발성(Non-volatile): 한 번 저장된 데이터는 변경되지 않음 (Inmon DW의 4대 특성) 유전자 알고리즘(GA) 상세 절차 - 유전자 알고리즘(Genetic Algorithm): 생물 진화 원리를 모방한 메타휴리스틱 최적화 - 6단계 절차: 1. 초기 해집단(Initial Population) 생성: 무작위 후보해 N개 생성 2. 적합도 평가(Fitness Evaluation): 각 해의 목적함수 값 계산 3. 선택(Selection): 적합도 비례 확률로 부모 선택 (룰렛휠·토너먼트) 4. 교차(Crossover): 두 부모 해를 결합해 자식 해 생성 (One-point·Two-point·Uniform) 5. 변이(Mutation): 자식 해 일부를 무작위 변경 — 지역 최적 탈출 6. 세대(Generation) 반복: 종료 조건까지 반복 - 염색체(Chromosome) / 유전자(Gene): 해의 표현 단위 - 해집단(Population): 한 세대의 모든 후보해 모음 GA 활용 사례 - 외판원 문제(TSP, Travelling Salesman Problem): 최소 거리 경로 탐색 - 차량 설계 최적화: 연료 효율 극대화 - 일정 최적화: 자원·시간 제약 하의 스케줄링 - 신경망 구조 탐색(NAS): 신경망 아키텍처 자동 설계 웹 데이터 수집 도구 - BeautifulSoup: Python의 HTML/XML 파싱 라이브러리 — 정적 페이지에 적합 - Selenium: 실제 브라우저를 제어해 동적 페이지 수집 — JS 렌더링 필요한 페이지 - Scrapy: 대규모 크롤링 프레임워크 — 비동기·확장성 - Requests: Python HTTP 클라이언트 — API 호출의 기본 Lakehouse 아키텍처 - 데이터 레이크하우스(Data Lakehouse): 데이터 레이크 + DW의 장점 결합 - 저장: 객체 스토리지(저렴·확장) - 트랜잭션·스키마: ACID 보장 - SQL·ML 워크로드 모두 지원 - 오픈 테이블 포맷: - Delta Lake: Databricks 주도 — Spark 친화적 - Apache Iceberg: Netflix 발 — 광범위한 엔진 지원 - Apache Hudi: 실시간 업서트 강점 검색·분석 엔진 - Elasticsearch: 분산 검색·분석 엔진 — Lucene 기반 - OpenSearch / Solr: 검색 엔진 대안 - Druid / ClickHouse / Pinot: 실시간 OLAP 분석 DB 공간 데이터·GIS - GIS(Geographic Information System, 지리정보시스템): 공간 데이터를 저장·분석·시각화하는 시스템 - 공간 분석(Spatial Analysis): 위치·근접성·공간 패턴 분석 - 공간 데이터: 점(Point)·선(Line)·면(Polygon) — 위도(Latitude)·경도(Longitude) 좌표 - 지오코딩(Geocoding): 주소 → 좌표 변환 - 역지오코딩(Reverse Geocoding): 좌표 → 주소 변환 - GeoIP: IP 주소로 위치 추정 - 공간 통계: Moran's I·Getis-Ord Gi — 공간 자기상관 측정 - 공간 인덱스: R-tree·Quadtree·Geohash — 공간 검색 가속화 시뮬레이션과 확률 - 시뮬레이션(Simulation): 모델을 통해 실제 시스템 행동을 모방 - 몬테카를로 시뮬레이션(Monte Carlo Simulation): 무작위 표본으로 적분·확률 추정 - 이산 사건 시뮬레이션(Discrete Event Simulation): 사건이 이산 시점에 발생하는 시스템 모형 - 시스템 다이내믹스(System Dynamics): 피드백 루프·시간 지연을 가진 시스템 모형 분석 활용 영역 - 운영 분석(Operational Analytics): 실시간 운영 데이터를 분석해 즉각적 의사결정 — 트랜잭션·서비스 모니터링 - 효과 분석(Impact Analysis): 정책·조치·캠페인의 결과 측정 — A/B 테스트·DiD 등 활용 - 수익성 분석(Profitability Analysis): 고객·상품·채널별 수익 기여도 측정 분석 접근 방식 추가 - 혼합 분석(Mixed Methods): 정량 분석 + 정성 분석을 결합 - 정량: 수치·통계·ML - 정성: 인터뷰·관찰·텍스트 분석 - 양적·질적 데이터를 모두 활용해 한쪽으로는 보이지 않는 통찰 발견 - 예: 매출 데이터 + 고객 인터뷰로 이탈 원인 종합 분석 데이터 종류 추가 - 관리 데이터(Managed Data): 거버넌스 하에 표준·품질·보안 관리되는 데이터 - 운영 데이터와 관리 데이터의 구분: 운영은 처리 대상, 관리는 자산화·통제 데이터웨어하우스·데이터레이크 (한 단어 표기) - 데이터웨어하우스(DW, Data Warehouse): 정제·통합·축적된 분석용 데이터 저장소 - Schema-on-Write: 저장 시 스키마 정의 - SQL 분석에 최적화 - 데이터레이크(Data Lake): 원본 데이터를 가공 없이 저장 - Schema-on-Read: 읽을 때 스키마 적용 - 비정형·반정형 데이터 포함 - 데이터마트(DM, Data Mart): 부서·주제별 소규모 DW - 데이터 레이크하우스(Lakehouse): 데이터 레이크 + DW 장점 결합 (Delta Lake·Iceberg·Hudi) 의사결정 지원 시스템 - DSS(Decision Support System, 의사결정 지원 시스템): 데이터·모델·시뮬레이션으로 비구조적 의사결정 지원 - EIS(Executive Information System): 경영진 의사결정 지원에 특화 - BI(Business Intelligence): DSS의 확장 — 데이터 → 정보 → 인사이트 → 행동 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - YARN — 자원 관리 + 작업 스케줄링 (Yet Another Resource Negotiator) - Pig — 데이터 흐름 언어(Pig Latin) — ETL에 강점 - HBase — 컬럼 기반 NoSQL — HDFS 위에서 동작 - Sqoop — RDBMS ↔ Hadoop 데이터 전송 - Kafka — 분산 메시지 큐 — 실시간 스트림 파이프라인 - Impala / Tez — 저지연 SQL 엔진 — Hive보다 빠른 쿼리 - ETL / ELT — 추출·변환·적재 / 추출·적재·변환(클라우드 시대 ELT 증가) - 웹 스크래핑 — 특정 페이지에서 원하는 데이터만 추출 - 센서·IoT 데이터 — RFID·GPS·온도·가속도 등 사물에서 생성된 데이터 - 준지도학습 — 일부만 라벨된 데이터로 학습 — 라벨링 비용 절감 - 진단 분석 — 왜 일어났는가? — 원인 분석·드릴다운·상관 분석 - DataFrame API — SQL 친화적인 구조화 데이터 처리 인터페이스 — Catalyst 옵티마이저로 자동 최적화 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (8개)

연관규칙학습의 대표 사례는?
장바구니 분석: "기저귀 구매 고객이 맥주도 함께 산다"
Apriori, FP-Growth 알고리즘 사용
유전 알고리즘이란? 활용 예는?
자연선택·돌연변이를 모방한 최적화 알고리즘
활용 예: 자동차 설계를 세대 거듭하며 개선해 연료 효율 극대화
회귀분석 vs 군집분석(유형분석)의 차이는?
회귀분석: 연속형 수치 예측 (기온→판매량)
군집분석: 사용자 특성에 따라 그룹 분류 (고객 세분화)
감정분석(Sentiment Analysis)이란?
텍스트에서 작성자의 감정(긍정/부정)을 분석
활용: 고객 리뷰, 소셜미디어 여론 분석
기계학습(Machine Learning)의 정의는?
컴퓨터가 훈련 데이터에서 스스로 패턴을 파악해 새로운 데이터에 예측하는 기술
예: 넷플릭스 영상 추천
협업 필터링 vs 콘텐츠 기반 추천 차이는?
협업 필터링: 사용자/항목 간 유사성 (행동 기반)
콘텐츠 기반: 항목 속성·태그·텍스트 (메타데이터 기반)
하이브리드: 둘을 결합 (Netflix, YouTube)
추천 시스템의 콜드스타트(Cold Start) 문제란?
신규 사용자나 신규 항목에 대한 데이터가 부족하여 추천이 어려운 문제
해결: 인기 항목 추천, 콘텐츠 기반 추천, 인구통계 정보 활용
빅데이터 처리 5단계 순서는?
수집(Collection) → 저장(Storage) → 처리(Processing) → 분석(Analysis) → 시각화(Visualization)
ETL/Hadoop/Spark/Tableau 등 단계별 도구

이 주제의 관련 기출 퀴즈 풀기 »