데이터 사이언스와 데이터 사이언티스트

과목: 데이터 이해 (1과목, 11번 주제) ·

키워드: DBMS · 빅데이터 · 데이터 사이언스 · 분석 주제 유형 · 하향식·상향식 접근 · 의사결정나무 · 데이터 마트 · 데이터 기반 의사결정 · 강화학습·지도학습 · SQL · 하둡·빅데이터 인프라

정의: 데이터 사이언스는 정형, 반정형, 비정형 등 다양한 형태의 데이터에서 의미와 가치를 추출하는 학문입니다.

데이터 사이언스는 정형, 반정형, 비정형 등 다양한 형태의 데이터에서 의미와 가치를 추출하는 학문입니다. 수학, 통계학, 컴퓨터공학, 데이터공학 등을 아우르는 총체적(holistic) 접근법을 사용합니다. 데이터 분석가는 분석 보고서와 시각화 자료를 작성하여 데이터 기반의 의사결정을 돕는 역할을 합니다. 데이터 사이언티스트는 머신러닝 및 AI를 활용하기 위한 코딩 스킬과 통계적 지식을 갖춘 전문가입니다. 필요한 역량은 크게 하드 스킬과 소프트 스킬로 나뉩니다. 하드 스킬에는 머신러닝, 모델링, 데이터 기술 역량 등 기술적 이론 지식이 포함됩니다. 소프트 스킬에는 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션(고객 공감 능력) 등이 포함되며, 이를 통해 통찰력 있는 분석 능력을 발휘합니다. 가트너(Gartner)가 주장한 데이터 사이언티스트의 핵심 역량은 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 네 가지이며, 여기서 주의할 점은 하드 스킬이 포함되지 않는다는 것입니다. 또한 시험에서 "타인과의 의사소통 능력은 중요하지 않다"는 보기가 나오면 반드시 틀린 것입니다. 데이터 사이언티스트에게 커뮤니케이션 능력은 필수적인 소프트 스킬입니다. 효과적인 분석 모델 개발을 위해서는 인문학적 요소도 중요합니다. 분석 모델이 예측할 수 없는 위험 요소를 지속적으로 판단하고, 모델의 한계에 대해 끊임없이 의구심을 가져야 합니다. 과학 기반의 정량 분석과 인문학적 통찰을 결합한 합리적 추론이 필요하며, 특히 인과관계보다 상관관계 분석 기반의 인사이트가 중요해지고 있습니다. 핵심 요약 & 시험 포인트 데이터 사이언스 - 다양한 형태의 데이터에서 의미/가치를 추출하는 학문 - 총체적(holistic) 접근법: 수학, 통계학, 컴퓨터공학, 데이터공학 등 융합 - 데이터 분석가: 분석 보고서·시각화 자료 작성 → 데이터 기반 의사결정 데이터 사이언티스트 역량 구분 내용 하드 스킬 Machine Learning, Modeling, Data Technical Skill 소프트 스킬 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션 시험 포인트: - 가트너 주장 역량: 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 (하드 스킬 제외) - 의사소통 능력은 중요합니다 — "의사소통이 중요하지 않다"는 틀린 설명 (47회 출제) - 인문학적 요소: 분석 모델의 한계를 끊임없이 고찰, '상관관계' 분석 기반 인사이트 중시 가치 패러다임의 변화 데이터 사이언티스트 역량 — Hard Skills vs Soft Skills Hard Skills (분석 기술 역량) 영역 세부 역량 통계·수학 통계학, 선형대수, 미적분 머신러닝 지도/비지도 학습 알고리즘, 평가 분석 도구 R, Python, SQL, Spark 빅데이터 인프라 Hadoop, Spark, NoSQL, 클라우드 데이터 엔지니어링 ETL, 데이터 파이프라인 Soft Skills (커뮤니케이션·통찰 역량) 영역 세부 역량 비즈니스 도메인 지식 산업 이해, 도메인 인사이트 호기심·창의력 문제 정의, 가설 수립 스토리텔링 분석 결과를 이해하기 쉽게 전달 시각화 비전문가도 이해할 수 있는 그래프 협업·소통 다양한 부서·전문가와 협업 시험 포인트: ADsP에서 "데이터 사이언티스트는 Hard Skills만 갖추면 된다"는 보기는 틀림. Soft Skills가 동등하게 중요. 통찰력·스토리텔링·창의성이 핵심. 추가 핵심 개념 — 데이터 사이언티스트의 역할 확장 - CDO(Chief Data Officer): 조직의 데이터 전략·자산을 총괄하는 임원으로 데이터 거버넌스의 최상위 책임자. - Data Owner: 특정 데이터 도메인의 비즈니스 책임자(현업 부서). 데이터 정의·접근 권한 결정. - Data Steward: 데이터 품질·표준·메타데이터를 실무적으로 관리하는 역할(분석가·DBA 협업). - Data Custodian: 데이터 저장·보안·백업·운영을 책임지는 IT 기술 담당. - 알고리즈미스트(Algorithmist): 알고리즘의 공정성·투명성을 감시하고 피해자 입장에서 알고리즘을 검증하는 새로운 직업군. 빅데이터 위기 요인 "데이터 오용"의 통제 수단. - 디지털 전환(DX, Digital Transformation): 단순 디지털화(Digitization)·디지털 업무화(Digitalization)를 넘어 비즈니스 모델·문화·고객 경험을 근본 혁신. Netflix·Uber가 대표 사례. 시험 핵심: CDO·Data Owner·Data Steward·Custodian의 역할 구분과 알고리즈미스트는 거버넌스·윤리 문제와 결합되어 자주 출제됩니다. 데이터 직무·조직 명칭 - 데이터 사이언티스트(Data Scientist): 통계·ML·도메인 지식을 결합해 데이터에서 비즈니스 가치 창출 - CDO(Chief Data Officer): 최고데이터책임자 — 데이터 전략·거버넌스·품질·활용 총괄 - 데이터 거버넌스 역할군: Data Owner(소유자), Data Steward(관리자), Data Architect(설계자) 설명가능 AI (XAI) - XAI(Explainable AI): 모델 예측 근거를 사람이 이해할 수 있도록 설명 - SHAP: 각 특성의 기여도를 게임이론(Shapley value) 기반으로 계산 - LIME: 특정 예측 주변을 단순 모델로 근사해 설명 - 공정성(Fairness) / 알고리즘 편향: 학습 데이터·모델이 특정 집단에 불리한 결정을 내리지 않도록 진단·완화 데이터 사이언티스트의 도구 - 시각화 도구: - Tableau: 드래그-앤-드롭 BI, 대시보드 표준 - Power BI: 마이크로소프트 BI 플랫폼, Excel 친화 - QlikView / QlikSense: 연관 모델 기반 BI - Looker / Superset: 클라우드 BI - 분석 환경: - Jupyter Notebook: 셀 단위 실행, Python·R·Julia 지원 - Anaconda: 과학 컴퓨팅 패키지 배포판 - Colab: 구글 클라우드 무료 Jupyter — GPU 제공 - MLOps: - Docker / Kubernetes: 컨테이너화·오케스트레이션 - Airflow: 워크플로 스케줄링 - MLflow / Kubeflow: ML 라이프사이클 관리 데이터 사이언티스트 역량 - Hard Skill(하드 스킬): 통계·수학·프로그래밍·머신러닝·DB·도구 활용 등 기술적 역량 - Soft Skill(소프트 스킬): 분석적 사고·비판적 사고·호기심·커뮤니케이션·스토리텔링·도메인 이해 - 다분야 협력(Cross-functional Collaboration): 개발·마케팅·도메인 전문가와의 협업 - 분석적 사고(Analytical Thinking): 문제를 구조화하고 데이터로 검증 - 스토리텔링(Storytelling): 분석 결과를 직관적으로 전달하는 능력 - 통찰력(Insight): 데이터 너머의 의미와 함의를 발견하는 능력 데이터 거버넌스 직무 역할 (상세) - Data Owner(데이터 오너): 해당 데이터의 사업적 책임자 — 정의·접근·품질 책임 - Data Steward(데이터 스튜어드): 데이터 표준·메타데이터·품질을 관리하는 실무 운영자 - Data Custodian(데이터 관리자): 물리적 저장·백업·보안 등 기술적 관리 책임 - Data Architect(DA): 전사 데이터 모델·구조 설계 - DBA(Database Administrator): DBMS 운영·튜닝·백업 분석 가치사슬과 데이터 직무 - 데이터 엔지니어(수집·파이프라인) → 데이터 분석가(탐색·보고) → 데이터 사이언티스트(모델링) → ML 엔지니어(배포·운영) Python 분석 라이브러리 - NumPy: 다차원 배열·선형대수 — Python 과학컴퓨팅의 기초 - Pandas: DataFrame·Series — 표 형식 데이터 조작의 표준 - Scikit-learn: 머신러닝 알고리즘 모음 — 분류·회귀·군집·전처리·평가 - TensorFlow / PyTorch / Keras: 딥러닝 프레임워크 — Keras는 TF/Theano 위의 고수준 API - matplotlib / seaborn / plotly: 시각화 라이브러리 데이터 분석 직무 세부 - 데이터 분석가(Data Analyst): 비즈니스 질문에 답하는 보고·시각화·EDA - 데이터 엔지니어(Data Engineer): 데이터 파이프라인·인프라 구축 - ML 엔지니어(MLE): 모델 학습·배포·운영 - 데이터 분석 컨설턴트: 외부 컨설팅·전략 수립 분석 환경 - 개발 환경 / 운영 환경 / 분석 샌드박스(Sandbox): 분석 코드 실험·검증을 위한 격리된 영역 T자형 / Π자형 인재 - T자형(T-shaped) 인재: 한 분야에 깊은 전문성(수직 막대) + 다양한 분야 이해(가로 막대) - 데이터 사이언티스트는 통계/ML 전문성 + 도메인·비즈니스 이해 - Π자형(Pi-shaped) 인재: 두 분야 이상의 깊은 전문성 + 폭넓은 이해 — 더 진화된 형태 - I자형 인재: 한 분야만 깊은 전형적 전문가 — 협업·확장성 부족 도메인 지식 - Domain Knowledge(도메인 지식): 분석 대상 산업·업무에 대한 이해 - 데이터 사이언티스트의 성공은 통계·코딩 기술만큼 도메인 이해에 좌우 — 변수 선택·결과 해석·의사결정 모두에 영향 - Stakeholder(이해관계자) 관리 능력도 필수 역량 분석 문화 확산 - 데이터 리터러시(Data Literacy): 데이터를 읽고·해석하고·활용하는 능력 — 전사적 분석 문화의 기반 - 데이터 리터러시 교육은 분석 성숙도 향상의 핵심 활동 - CoE(Center of Excellence): 분석 전문 조직 — 표준·교육·플랫폼 제공 클라우드 데이터 웨어하우스 - Snowflake: 멀티 클라우드 DW — 컴퓨팅·저장 분리 - Amazon Redshift: AWS의 컬럼 기반 DW - Google BigQuery: 서버리스 DW — 페타바이트급 SQL 분석 - 모두 SaaS 형태, 빠른 SQL 분석에 특화 R 추가 도구 - R Shiny: R 기반 대화형 웹 앱 프레임워크 — 분석 결과를 대시보드로 배포 - Streamlit / Dash: Python 기반 동등 도구 새로운 데이터 직무 트렌드 - Citizen Data Scientist(시민 데이터 사이언티스트): 비전공자가 AutoML·BI 도구로 분석 수행 — 분석 민주화의 결과 - Analytics Coordinator(분석 조정자): 비즈니스와 분석가 사이의 가교 역할 - Hardcore Data Scientist: 알고리즘·통계 깊이 있는 전문가 분석 성공 요인 - CSF(Critical Success Factor, 핵심 성공요인): 프로젝트 성공의 결정적 요인 — 경영진 지원·데이터 품질·도메인 협력·인재 통찰(Insight)의 본질 - 통찰(Insight): 데이터 분석을 통해 발견한 비즈니스에 가치를 주는 새로운 이해 - 단순 사실(Fact) → 의사결정에 영향을 주는 통찰로 변환되어야 가치 창출 - 통찰 생성 절차: 데이터 → 정보 → 지식 → 통찰 → 행동(Actionable Insight) 삼각측량(Triangulation) - 데이터 삼각측량(Data Triangulation): 여러 출처·방법·이론을 결합해 결과의 신뢰성 향상 - 정량 + 정성 데이터의 결합, 다중 모형 검증 - 신뢰성·타당성 확보 기법 데이터 사이언티스트의 핵심 역량 (5대) 1. 분석 역량(Analytical Skill): 통계·수학·ML 이론과 적용 2. 기술 역량(Technical Skill): SQL·Python·R·빅데이터 도구 3. 비즈니스 역량(Business Skill): 도메인 이해·의사결정 지원 4. 커뮤니케이션 역량(Communication Skill): 시각화·스토리텔링·발표 5. 협업 능력(Collaboration): 다분야·다부서 팀워크 분석 환경 구축 - 데이터 분석 환경(Analytics Environment): 분석가가 효율적으로 작업할 수 있는 통합 환경 - 구성 요소: 컴퓨팅 인프라(클러스터·클라우드), 데이터 저장소(DW·DM·Lake), 분석 도구(Jupyter·RStudio), 협업 도구(Git·Wiki) - 분석 인프라(Analytics Infrastructure): 분석을 위한 하드웨어·소프트웨어·네트워크의 총체 - Big Data Platform: 빅데이터 수집·저장·처리·분석·시각화의 통합 플랫폼 한국어 NLP 사전훈련 모델 - KoBERT(2019): SKTBrain이 공개한 한국어 BERT - KLUE(Korean Language Understanding Evaluation): 한국어 자연어 이해 벤치마크 - KoGPT: 카카오브레인의 한국어 GPT - HyperCLOVA(2021): 네이버의 한국어 거대 언어 모델 (Cloud X) - KoSimCSE / KoBigBird / KoElectra: 다양한 한국어 사전훈련 모델 분석 인력 양성 체계 - 데이터 분석가 양성 / 분석 인재 양성: 사내 교육·외부 교육·자격증 지원 - 자격증 트랙: ADsP(준전문가) → ADP(전문가) → SQLD/SQLP → DAsP/DAP - 외부 교육: 부트캠프·MOOC(Coursera·edX)·대학원 협력 📝 이 주제 관련 문제 학습 노트의 보강 개념을 직접 문제로 풀어보세요. - 데이터 거버넌스 역할군 — Data Owner(소유자), Data Steward(관리자), Data Architect(설계자) - 공정성(Fairness) / 알고리즘 편향 — 학습 데이터·모델이 특정 집단에 불리한 결정을 내리지 않도록 진단·완화 - 시각화 도구 — Tableau: 드래그-앤-드롭 BI, 대시보드 표준 - Power BI — 마이크로소프트 BI 플랫폼, Excel 친화 - Colab — 구글 클라우드 무료 Jupyter — GPU 제공 - Data Custodian — 물리적 저장·백업·보안 등 기술적 관리 책임 - NumPy — 다차원 배열·선형대수 — Python 과학컴퓨팅의 기초 - Pandas — DataFrame·Series — 표 형식 데이터 조작의 표준 - Soft Skill — 분석적 사고·비판적 사고·호기심·커뮤니케이션·스토리텔링·도메인 이해 - Data Steward — 데이터 표준·메타데이터·품질을 관리하는 실무 운영자 - T자형인재 — 한 분야에 깊은 전문성(수직 막대) + 다양한 분야 이해(가로 막대) - Π자형인재 — 두 분야 이상의 깊은 전문성 + 폭넓은 이해 — 더 진화된 형태 - … 보강 신규 문항 더 보기 페이지 하단 "이 주제 문제 풀기" 버튼으로 전체 문제를 풀 수 있습니다.

핵심 Q&A (7개)

데이터 사이언티스트의 하드 스킬 vs 소프트 스킬은?
하드 스킬: Machine Learning, Modeling, 데이터 기술
소프트 스킬: 창의적 사고, 스토리텔링, 시각화, 커뮤니케이션
가트너가 제시한 데이터 사이언티스트 4대 역량은?
① 데이터 관리
② 분석 모델링
③ 비즈니스 분석
④ 소프트 스킬
(하드 스킬은 포함되지 않음!)
데이터 사이언스의 정의는?
다양한 형태의 데이터에서 의미·가치를 추출하는 학문
수학·통계·컴퓨터·데이터공학을 아우르는 총체적(holistic) 접근
가트너 역량에 '하드 스킬'이 포함되지 않는 이유는?
시험 포인트: 가트너 4대 역량에는 하드 스킬이 없다.
의사소통 능력(소프트 스킬)은 필수다. '의사소통이 중요하지 않다'는 틀린 설명.
가치 패러다임 변화 3단계는?
Digitalization(아날로그→디지털)
→ Connection(연결 지향)
→ Agency(자율적 의사결정)
데이터 사이언티스트의 Hard Skills 5가지는?
통계·수학, 머신러닝, 분석 도구(R/Python/SQL), 빅데이터 인프라(Hadoop/Spark), 데이터 엔지니어링(ETL)
데이터 사이언티스트의 Soft Skills는 왜 중요한가?
비즈니스 도메인 지식, 호기심·창의력, 스토리텔링, 시각화, 협업·소통
분석 기술만으로는 통찰을 도출하고 전달할 수 없음. 두 역량의 균형이 핵심

이 주제의 관련 기출 퀴즈 풀기 »