현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

추정과 가설검정의 판단 체계

추정·신뢰구간·가설검정의 절차와 올바른 해석 기준을 익힌다.

예상 읽기 12

핵심 요약

추정은 표본으로 모집단 모수의 값과 불확실성을 표현하는 과정이다. 점추정은 하나의 값, 구간추정은 표준오차와 임계값을 이용한 범위를 제시한다. 가설검정은 귀무가설과 검정 모형이 맞다는 조건에서 관측 결과와 같거나 더 극단적인 결과가 나올 확률을 p-value로 계산한다.

p-value는 귀무가설이 참일 확률도, 효과가 우연히 생겼을 확률도 아니다. p<α는 사전에 정한 오류 기준에서 귀무가설과 자료가 양립하기 어렵다는 뜻이지 효과가 크거나 실무적으로 중요하다는 뜻이 아니다. 자료형, 표본의 독립·대응 관계, 분포와 분산 가정, 효과크기, 신뢰구간, 다중검정과 의사결정 비용을 함께 판단해야 한다.

학습 목표

  • 점추정·표준오차·신뢰구간의 의미와 계산을 연결한다.
  • 귀무가설·대립가설·유의수준·p-value를 정확히 해석한다.
  • 제1종 오류·제2종 오류·검정력과 표본크기의 관계를 설명한다.
  • 자료형과 표본 관계에 맞는 검정 및 강건한 대안을 선택한다.
  • 효과크기와 다중검정 보정, 동등성·비열등성 판단을 구분한다.
  • 검정 결과를 재현 가능하고 실무적으로 해석 가능한 형식으로 보고한다.

1. 추정의 구조

1.1 점추정과 추정량의 성질

개념의미확인 질문
점추정표본통계량 하나로 모수를 추정추정 대상 모수는 무엇인가?
편향E(θ̂)-θ반복 표본에서 체계적으로 치우치는가?
표준오차추정량 표본분포의 표준편차표본을 다시 뽑을 때 얼마나 변하는가?
일치성표본크기 증가 시 참값에 수렴자료가 늘면 오차가 줄어드는가?
효율성같은 조건에서 더 작은 분산대안 추정량보다 정밀한가?

표본평균 은 일반적인 독립·동일분포 조건에서 모평균 μ의 불편추정량이고, 표준오차는 σ/√n이다. 모표준편차 σ를 모르면 표본표준편차 s로 추정한다.

1.2 신뢰구간

신뢰구간의 공통 구조는 다음과 같다.

추정값±임계값×표준오차

정규모집단의 평균에서 σ를 모르면 t 임계값을 사용한다.

\bar X± t_1-\alpha/2,,n-1(S) ÷ (\sqrt n)

독립 베르누이 표본의 비율에 대한 큰 표본 Wald 구간은 다음 형태지만, 표본이 작거나 비율이 0 또는 1에 가까우면 Wilson 구간이나 정확 방법 등 더 안정적인 방법을 검토한다.

\hat p± z_1-\alpha/2\sqrt(\hat p(1-\hat p)) ÷ (n)

95% 신뢰구간의 빈도주의적 의미는 같은 표본추출과 구간작성 절차를 반복할 때 장기적으로 약 95%의 구간이 참 모수를 포함한다는 것이다. 계산이 끝난 특정 구간에 고정된 모수가 들어 있을 확률이 95%라고 해석하지 않는다.

계산 예제 1. 평균의 95% 신뢰구간

n=36, X̄=27, S=6이면 SE=6/√36=1이다. 자유도 35의 양측 95% t 임계값을 약 2.0301로 두면 신뢰구간은 27±2.0301×1, 즉 약 [24.9699, 29.0301]이다. 평균 30은 구간 밖에 있으므로 같은 가정의 양측 5% 검정에서는 H₀:μ=30을 기각한다.

2. 가설검정의 판단 절차

  1. 분석 목적, 대상 모집단, 추정할 모수와 실무 임계값을 정의한다.
  2. 귀무가설 H₀와 대립가설 H₁을 데이터 확인 전에 설정한다.
  3. 결과변수 유형, 표본의 독립·대응·집락 관계, 분포와 분산 가정을 확인한다.
  4. 검정통계량과 귀무가설 아래의 표본분포를 정한다.
  5. p-value 또는 기각역을 계산하고 사전 유의수준 α와 비교한다.
  6. 효과크기와 신뢰구간, 가정 민감도, 다중검정 보정을 함께 평가한다.
  7. 통계적 결론과 사업·정책·임상적 의사결정을 분리해 보고한다.

귀무가설은 흔히 차이·효과·연관이 없다는 기준 명제다. 대립가설은 양측 또는 사전에 정한 방향의 단측으로 설정한다. 데이터에서 방향을 확인한 뒤 유리한 단측검정으로 바꾸면 명목 제1종 오류율이 유지되지 않는다.

검정통계량은 관측 효과가 귀무가설 값에서 표준오차 몇 개만큼 떨어져 있는지를 나타내는 경우가 많다.

검정통계량=(추정값-귀무가설 값) ÷ (귀무가설 아래 표준오차)

p-value는 H₀와 모형 가정이 참일 때, 사전에 정한 단측·양측 방향에서 관측 통계량 이상으로 H₀와 양립하기 어려운 통계량이 나올 확률이다.

계산 예제 2. 단일표본 t 검정

신규 절차의 평균 처리시간이 30분보다 짧은지 검정한다고 하자.

H_0:\mu=30, H_1:\mu<30

X̄=27, S=6, n=36이면 SE=1, t=(27-30)/1=-3, 자유도는 35다. 단측 p-value는 약 0.00247이므로 α=0.05에서 귀무가설을 기각한다. 관측 평균이 3분 줄었다는 효과의 크기와 신뢰구간도 함께 보고해야 한다.

3. 유의수준, 오류, 검정력

실제 상태와 판단H₀ 기각H₀ 기각하지 않음
H₀제1종 오류, 확률 α올바른 판단
H₁올바른 검출, 검정력 1-β제2종 오류, 확률 β
  • 유의수준 αH₀가 참일 때 잘못 기각할 확률의 상한을 분석 전에 정한 것이다.
  • 제2종 오류 β는 특정한 실제 효과가 있을 때 이를 검출하지 못할 확률이다.
  • 검정력 1-β는 특정한 실제 효과가 있을 때 귀무가설을 기각할 확률이다.

검정력은 효과크기, 표본크기, 변동성, 유의수준, 단측·양측 여부와 분석 방법에 따라 달라진다. α를 낮추면 다른 조건이 같을 때 제1종 오류는 줄지만 검정력도 낮아질 수 있다.

동일 크기 두 독립집단의 평균 차이를 검출하는 정규근사 표본수는 집단별로 다음처럼 계획할 수 있다.

n≈\frac2(z_1-\alpha/2+z_1-β)^2\sigma^2\delta^2

여기서 δ는 검출하려는 최소 평균차이, σ는 집단 내 표준편차다. 탈락률, 불균형 배정, 집락 설계효과가 있으면 추가 조정한다.

계산 예제 3. 검정력 기반 표본수

양측 α=0.05, 검정력 80%, σ=10, 최소 검출차이 δ=5를 가정하면 z₀.₉₇₅≈1.96, z₀.₈≈0.8416이다. 집단별 표본수는 2×(1.96+0.8416)²×10²/5²≈62.79이므로 올림하여 약 63명씩 필요하다. 이는 근사값이며 실제 설계와 사용할 검정에 맞춰 계산해야 한다.

4. 자료형과 설계에 맞는 검정 선택

목적·자료 구조기본 방법핵심 조건·대안
한 집단 평균과 기준값일표본 t심한 이상치·비대칭이면 강건 추정·Wilcoxon 부호순위 등 검토
두 독립집단 평균Welch t등분산을 별도 확신할 때만 pooled t; 분포·이상치 점검
같은 대상의 전후 평균대응 t개인별 차이를 분석; 차이의 분포 점검
세 집단 이상 평균ANOVA 또는 Welch ANOVA사후비교에는 다중검정 조정
두 범주형 변수의 연관카이제곱 독립성 검정기대도수가 작으면 Fisher 정확검정 등 검토
이분형 결과와 설명변수로지스틱 회귀오즈비, 비선형성, 분리, 집락구조 점검
두 연속변수의 선형 연관Pearson 상관비선형·이상치·서열자료는 Spearman 등 검토
반복측정·집락자료혼합모형·GEE·집락강건 SE독립표본 검정을 그대로 사용하지 않음

Welch t 검정은 두 독립집단의 분산과 표본크기가 달라도 사용할 수 있어 등분산을 자동 가정하는 pooled t보다 일반적인 기본 선택이 될 수 있다. 비모수 검정도 가정이 없는 검정은 아니며, 검정하는 위치·분포 가설이 연구 질문과 맞는지 확인한다.

5. 효과크기와 신뢰구간

통계적 유의성은 효과의 크기나 중요성을 보장하지 않는다. 표본이 매우 크면 작은 차이도 유의할 수 있고, 표본이 작으면 중요한 차이도 검출하지 못할 수 있다.

결과 유형절대 효과상대·표준화 효과해석 시 주의
연속형평균차이표준화 평균차이 d원단위 차이와 표준화 값을 함께 제시
이분형위험차이위험비·오즈비기저위험에 따라 절대효과가 달라짐
시간-사건특정 시점 생존율 차이위험비비례위험 가정과 시간축 확인
회귀예측값·한계효과 차이회귀계수·오즈비단위, 기준범주, 교란과 비선형성 명시

계산 예제 4. 절대효과와 상대효과

기존 공정 파손률이 12%, 개선 공정이 8%라면 절대위험차이는 0.08-0.12=-0.04, 즉 4%p 감소다. 위험비는 0.08/0.12≈0.6667로 약 33.3% 상대 감소다. 오즈비는 (0.08/0.92)/(0.12/0.88)≈0.6377이다. 같은 자료에서도 지표가 다르므로 분모와 기준집단을 명시하고 각 효과의 신뢰구간을 보고한다.

6. 신뢰구간과 검정의 관계, 동등성

동일한 양측 모형·표준오차·유의수준을 사용하면, 귀무가설 값이 (1-α) 신뢰구간 밖에 있을 때 양측 검정은 유의하다. 단측검정, 다중검정 조정, 비대칭 구간, 정확검정에서는 대응 조건을 맞춰야 한다.

p≥α는 효과가 0임을 증명하지 않는다. ‘차이가 실질적으로 없음을’ 주장하려면 사전에 동등성 한계 [-Δ,Δ]를 정하고 두 단측검정(TOST)이나 동등성 신뢰구간을 사용한다. 비열등성 검정도 허용 가능한 열등 한계를 사전에 정해야 한다. 데이터 확인 후 한계를 정하면 판단 기준이 왜곡된다.

질문적절한 목표
차이가 있는가?우월성 검정
허용 범위 안에서 사실상 같은가?동등성 검정
새 방법이 허용 한계보다 나쁘지 않은가?비열등성 검정

7. 다중검정과 선택 편향

서로 독립인 20개 귀무가설을 각각 α=0.05로 검정하면 모두 참일 때 하나 이상 거짓양성이 나올 확률은 1-0.95²⁰≈0.6415다. 검정군(family)을 분석 목적에 맞게 정의하고 보정 방법을 사전에 정한다.

  • Bonferroni: 가족별 오류율(FWER)을 제어하기 위해 각 검정에 α/m을 사용한다.
  • Holm: p-value를 정렬해 단계적으로 비교하며 Bonferroni보다 보통 덜 보수적이다.
  • Benjamini–Hochberg: 발견 중 거짓발견 비율(FDR)을 제어하는 절차다.
\alpha_Bonferroni=(\alpha) ÷ (m)

계산 예제 5. Bonferroni 보정

20개 검정을 가족별 α=0.05로 관리하면 Bonferroni 기준은 0.05/20=0.0025다. 개별 p-value가 0.003이면 보정 전 0.05 기준에서는 유의하지만 Bonferroni 기준에서는 유의하지 않다. 보정 방법과 검정 개수, 보정 전후 p-value를 함께 보고한다.

8. 가정 위반과 해석의 경계

  • 독립성 위반: 집락·반복측정·시계열 구조에 맞는 표준오차나 모형을 사용한다.
  • 선택 편향: 대표성이 없는 표본의 작은 p-value로 모집단 일반화를 보장할 수 없다.
  • 결측: 결측 메커니즘과 처리 방법을 명시하고 민감도 분석을 검토한다.
  • 이상치·비정규성: 시각화와 잔차를 확인하고 변환·강건법·재표집을 검토한다.
  • 모형 탐색 후 검정: 변수·하위집단·방향을 데이터로 선택했다면 명목 p-value가 과도하게 낙관적일 수 있다.
  • 인과 해석: 무작위배정이나 충분한 인과설계 없이 연관 검정을 원인 효과로 확대하지 않는다.

전수조사라도 측정오차, 미래 변동, 다른 모집단으로의 일반화와 인과 식별 문제는 남는다. 통계적 유의성은 비용·안전·정책·최소 중요차이와 별도로 판단한다.

9. 결과 보고 체크리스트

  1. 분석 대상, 표본크기, 결측·제외 기준과 분석단위를 명시한다.
  2. 추정할 모수, 귀무·대립가설, 단측·양측 방향과 유의수준을 제시한다.
  3. 사용한 검정·모형, 표준오차 방식, 자유도와 핵심 가정을 기록한다.
  4. 효과크기, 신뢰구간, 검정통계량, 자유도, 정확한 p-value를 함께 보고한다.
  5. 다중검정 보정, 사전등록 여부, 민감도 분석과 한계를 공개한다.
  6. 통계적 결론과 실무 의사결정을 구분하고 최소 중요효과와 비교한다.
같은 절차로 만든 20개의 95% 신뢰구간 중 대부분이 참값 선을 포함하고 일부는 포함하지 않는 구간도
같은 절차로 만든 20개의 95% 신뢰구간 중 대부분이 참값 선을 포함하고 일부는 포함하지 않는 구간도

95% 신뢰수준은 같은 절차를 반복했을 때 생성된 구간 중 약 95%가 참값을 포함한다는 장기 빈도 의미다. 이미 계산된 한 구간에 참값이 들어 있을 확률이 95%라고 해석하지 않는다.

CI=\widehatθ± c_\alpha/2,SE(\widehatθ)
귀무가설이 참·거짓인 실제 상태와 기각·기각하지 않음 결정을 교차해 제1종 오류 알파, 제2종 오류 베타, 검정력을 배치한 표
귀무가설이 참·거짓인 실제 상태와 기각·기각하지 않음 결정을 교차해 제1종 오류 알파, 제2종 오류 베타, 검정력을 배치한 표

귀무가설이 참인데 기각하면 제1종 오류 $\alpha$, 거짓인데 기각하지 않으면 제2종 오류 $\beta$다. 검정력은 거짓 귀무가설을 올바르게 기각할 확률 $1-\beta$이며 “기각하지 않음”은 귀무가설이 참임을 증명한 것이 아니다.

실제 상태·결정H₀ 기각H₀ 기각하지 않음
H₀ 참제1종 오류 α올바른 결정 1-α
H₀ 거짓올바른 기각·검정력 1-β제2종 오류 β

시험 판단 포인트

  • p-value는 귀무가설과 검정 가정 아래 계산하며 귀무가설의 참 확률이 아니다.
  • p≥α는 귀무가설을 기각할 근거 부족이지 동일성의 증명이 아니다.
  • 신뢰구간은 효과의 방향·크기·정밀도를 함께 보여준다.
  • 독립·대응·집락 관계와 결과변수 유형에 따라 검정이 달라진다.
  • Welch t는 독립 두 집단의 등분산을 요구하지 않으며, 대응자료에는 대응분석을 사용한다.
  • 효과크기와 실무 임계값은 통계적 유의성과 별도로 해석한다.
  • 반복 검정은 FWER 또는 FDR 등 목적에 맞는 오류율을 관리한다.
  • 동등성·비열등성 한계는 데이터 확인 전에 정한다.

자주 틀리는 부분

  • p-value를 귀무가설이 참일 확률이나 결과가 우연일 확률로 해석하지 않는다.
  • 유의하지 않은 결과를 두 집단이 완전히 같다는 증거로 보지 않는다.
  • 데이터 확인 후 양측검정을 단측검정으로 바꾸지 않는다.
  • 등분산 검정 결과만 보고 pooled t와 Welch t를 기계적으로 전환하지 않는다.
  • 여러 검정 중 작은 p-value만 골라 보고하지 않는다.
  • 오즈비를 위험비나 절대위험 감소와 같은 값으로 해석하지 않는다.
  • 통계적 연관을 설계 근거 없이 인과효과로 표현하지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

0195% 신뢰구간의 빈도주의적 해석을 서술하시오.
정답 및 해설

같은 절차를 반복하면 장기적으로 약 95%의 구간이 참 모수를 포함한다.

95% 신뢰수준은 고정된 모수에 대해 구간작성 절차가 장기적으로 갖는 포함률이다. 같은 조건에서 표본추출과 구간 계산을 반복하면 약 95%의 구간이 참 모수를 포함한다.

02같은 환자의 치료 전후 연속형 값을 비교할 때 기본적으로 적합한 구조는?
정답 및 해설

개인별 차이를 이용한 대응표본 분석

같은 환자의 전후 측정값은 서로 연결되어 있다. 환자별 차이를 계산하는 대응표본 분석은 개인 간 변동을 제거하고 차이의 표준오차를 사용한다.

0320개 검정을 Bonferroni 방식으로 가족별 α=0.05에 관리할 때 개별 검정 기준은?
정답 및 해설

0.0025

Bonferroni 기준은 가족별 유의수준을 검정 개수로 나눈 α/m이다. 따라서 0.05/20=0.0025다.

04p=0.08, α=0.05인 결과의 해석을 서술하시오.
정답 및 해설

5% 기준에서 귀무가설을 기각할 근거가 충분하지 않으며 효과크기·신뢰구간·검정력을 함께 본다.

p-value가 사전 유의수준보다 크므로 해당 기준에서 귀무가설을 기각할 근거가 충분하지 않다. 이는 귀무가설의 참을 증명하거나 효과가 없음을 확정한 것이 아니다. 동등성을 주장하려면 사전 한계와 동등성 검정이 필요하다.