Learning archive Source repository ↗

2026 · ODA DATA · ADVANCED STATISTICS

데이터 고급 통계
분석 실무 활용

AI로 통계 분석의 난이도를 낮추되, 결과의 타당성은 사람이 검증합니다. World Bank WDI 실데이터를 Python과 STATA 양쪽에서 분석하고 폐쇄망 업무까지 연결합니다.

구성5개 실습 모듈
발표자료43 slides
분석 도구Python + STATA
데이터World Bank WDI

회귀·교차표·패널 분석을 직접 실행합니다. 문법을 외우기보다 AI와 분석을 설계하고, 같은 결과를 두 도구에서 대조하며, 사람이 반드시 확인해야 할 지점을 배웁니다.

01

TOOLS & ENVIRONMENTS

Python과 STATA,
두 환경을 연결한다

외부망에서는 AI와 Python(Colab)을 이용해 빠르게 배우고 실험합니다. 실제 폐쇄망 업무에서는 인터넷과 AI 없이 실행 가능한 STATA 코드를 사용합니다. 도구의 우열보다 환경과 작업에 맞는 선택이 출발점입니다.

  • 외부망 · 학습AI와 Colab으로 분석 아이디어를 시험하고 코드를 설명받습니다.
  • 폐쇄망 · 적용검토한 STATA .do 파일과 데이터를 반입해 오프라인으로 재현합니다.
02

LOAD & CLEAN

WDI 실데이터를 불러오고 정제한다

World Bank 공식 API에서 수집한 2000~2022년 국가×연도 패널을 사용합니다. 결측값, 이상값, 지역·소득그룹과 같은 범주형 정보를 확인하고 분석 가능한 구조로 바꿉니다.

  • 진짜 데이터GDP, 기대수명, 아동사망률, 인구, 취학률에서 현실의 불완전성을 만납니다.
  • 양쪽으로 재현같은 정제 과정을 Python 노트북과 STATA 코드에서 비교합니다.
핵심 질문 — 분석 결과가 이상할 때 모델보다 먼저 데이터의 단위·결측·범위를 확인했는가?
03

CORE ANALYSIS

교차표·검정·회귀를
같은 데이터로 비교한다

지역×소득그룹 교차표로 분포를 읽고, t검정과 ANOVA로 집단 차이를 살펴봅니다. GDP와 기대수명의 Preston 곡선을 통해 로그변환과 회귀 설계를 배우고 유의성과 실질적 의미를 구분합니다.

  • 질문에 맞는 분석분포, 집단 차이, 변수 관계에 따라 서로 다른 통계 도구를 선택합니다.
  • 숫자는 같다Python과 STATA의 출력 모양은 달라도 같은 모형의 핵심 결과는 일치해야 합니다.
04

CAUSAL & MACHINE LEARNING

고정효과로 통제하고
머신러닝으로 확장한다

단순 관계를 인과효과로 해석할 때 생기는 식별 문제를 확인합니다. 국가와 연도 고정효과를 단계적으로 더하면서 계수가 어떻게 변하는지 살펴보고, Python에서는 API 실시간 수집과 머신러닝 영역까지 확장합니다.

  • 이원 고정효과관찰되지 않는 국가 특성과 공통 연도 충격을 통제해 답이 바뀌는 과정을 봅니다.
  • 도구의 강점STATA는 검증된 통계 흐름에, Python은 수집·자동화·머신러닝 확장에 강점을 가집니다.
05

HUMAN VERIFICATION

AI가 낮춘 난이도를
사람의 검증력으로 보완한다

AI가 코드를 빠르게 만들수록 잘못된 분석도 빠르게 완성될 수 있습니다. 시각화로 이상을 찾고, 도메인 지식으로 맥락을 점검하며, 동료 회람을 통해 혼자 놓친 가정을 드러냅니다.

  • 시각화분포·이상치·비선형 관계를 그려 숫자표가 숨기는 패턴을 확인합니다.
  • 도메인과 회람현장 맥락과 동료 검토를 통해 통계적으로 그럴듯한 오류를 걸러냅니다.
과정의 원칙 — AI로 분석의 진입장벽은 낮추되, 해석과 의사결정의 책임은 사람에게 남깁니다.

DATA, CODE & PRACTICE

같은 분석을
직접 재현합니다