현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

앙상블과 비모수 분석

앙상블 학습의 구조와 자료 조건에 맞는 비모수 검정을 익힌다.

예상 읽기 12

핵심 요약

앙상블은 여러 예측기를 결합하는 예측 방법, 비모수 분석은 특정 유한 차원의 분포모형을 강하게 가정하지 않고 순위·부호·재표본을 이용하는 추론 방법이다. 둘은 “모수가 없다”거나 “가정이 없다”는 뜻으로 묶을 수 없다.

배깅과 랜덤포레스트는 병렬 학습과 평균·투표로 주로 분산을 줄인다. 부스팅은 현재 오차를 보완하도록 학습기를 순차 추가한다. 스태킹은 기본모형의 폴드 밖(out-of-fold, OOF) 예측으로 메타모형을 학습해야 한다. 비모수 검정은 독립·대응 구조, 집단 수, 측정척도, 분포의 모양과 대칭성 가정을 먼저 확인한다.

학습 목표

  • 예측기 수와 오차 상관이 앙상블 분산에 미치는 영향을 계산한다.
  • 배깅·랜덤포레스트의 부트스트랩과 OOB 추정을 설명한다.
  • 부스팅의 순차 갱신과 학습률·반복 수의 관계를 판단한다.
  • 스태킹의 OOF 학습·전체 훈련 재적합·최종 추론 절차를 설명한다.
  • 독립·대응 여부와 집단 수로 순위 기반 검정을 선택한다.
  • Mann–Whitney U, Wilcoxon 부호순위, Kruskal–Wallis, Friedman, Spearman의 가정과 귀무가설을 구분한다.
  • p-value와 효과크기·구간·다중비교·실질적 중요성을 함께 해석한다.

1. 앙상블의 효과: 다양성과 오차 상관

회귀 예측기 B개의 오차가 각각 분산 σ², 서로 같은 상관 ρ를 갖는 단순한 경우, 평균 앙상블 오차의 분산은 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
Var(평균 오차) = σ²[ρ + (1-ρ)/B]

B=100, σ²=1, ρ=0.20이면 분산은 0.20+0.80/100=0.208이다. 예측기들이 독립인 ρ=0이면 0.01까지 줄지만, 상관이 0.20이면 나무 수를 무한히 늘려도 하한은 약 0.20이다. 따라서 개수뿐 아니라 각 예측기의 품질과 오류 다양성이 중요하다.

결합 방식대표 과업장점주의점
다수결분류 라벨단순하고 이상 확률값 영향이 작음신뢰도 크기를 버림
확률 평균확률 분류예측 강도를 반영기본 확률의 보정 상태 확인
가중 평균분류·회귀성능 차이를 반영가중치는 검증자료에서 정하고 테스트에 맞추지 않음
중앙값·절사평균회귀극단 예측에 강건할 수 있음최적 결합임을 자동 보장하지 않음

앙상블도 훈련·검증·테스트 역할을 지켜야 한다. 여러 후보와 가중치를 같은 검증자료에 반복 선택하면 검증자료에도 과대적합할 수 있어 필요하면 중첩 교차검증이나 별도 검증자료를 사용한다.

2. 배깅·랜덤포레스트와 OOB

배깅은 크기 n인 훈련자료에서 n번 복원추출한 부트스트랩 표본을 여러 개 만들고 기본모형을 병렬 학습한다. 특정 관측치가 한 부트스트랩 표본에서 한 번도 선택되지 않을 확률은 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
P(OOB) = (1-1/n)^n  →  e^(-1) ≈ 0.368
P(한 번 이상 선택) ≈ 1-0.368 = 0.632

따라서 표본 하나에는 원자료의 서로 다른 관측치가 장기적으로 약 63.2% 포함되고 약 36.8%가 OOB로 남는다. 각 관측치를 제외하고 학습한 나무들의 예측만 모으면 OOB 오차를 얻는다.

랜덤포레스트는 부트스트랩에 더해 각 분할에서 전체 변수가 아닌 무작위 변수 부분집합만 후보로 사용한다. 강한 변수 하나가 모든 나무의 분할을 지배하는 현상을 줄여 나무 사이 상관을 낮출 수 있다.

하이퍼파라미터너무 작은 경우너무 큰 경우·상호작용
나무 수평균이 불안정계산량 증가, 일반적으로 분산 감소가 포화
최대 깊이과소적합개별 나무 고분산·복잡성 증가
리프 최소 표본매우 거친 경계작을수록 세밀하지만 잡음 적합 가능
분할 후보 변수 수나무가 약해질 수 있음나무 상관이 커질 수 있음

OOB는 하이퍼파라미터 비교와 내부 검증에 유용하지만 시간·집단 구조를 무시한 부트스트랩은 배포 분포를 재현하지 못할 수 있다. 최종 일반화 평가는 손대지 않은 외부·시간후행 테스트로 확인한다. 불순도 기반 변수중요도는 연속형·범주 수가 많은 변수에 편향될 수 있으므로, 별도 검증자료의 permutation importance와 과업지식을 함께 본다.

3. 부스팅: 순차 오차 보완

그래디언트 부스팅은 현재 모형 F_(m-1)의 손실을 줄이는 방향인 음의 기울기에 다음 약한 학습기 h_m을 적합하고 학습률 η만큼 더한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
F_m(x) = F_(m-1)(x) + ηh_m(x)

제곱오차에서는 음의 기울기가 현재 잔차와 연결된다. AdaBoost는 오분류 관측치의 가중치를 높여 다음 분류기가 더 집중하게 하므로 심한 라벨 잡음·이상치에 민감할 수 있다.

조절 요소효과판단
학습률 η각 학습기의 기여 축소작으면 대개 더 많은 반복 필요
학습기 수순차 보완 횟수너무 적으면 과소적합, 너무 많으면 검증 성능 악화 가능
나무 깊이한 단계에서 표현할 상호작용깊을수록 복잡도와 과대적합 위험 증가
subsample·열 샘플링확률적 다양성과 규제너무 작으면 편향·불안정 증가 가능
조기 종료최적 반복 수 선택검증자료로 결정하고 테스트는 사용하지 않음

“부스팅은 항상 편향만 줄인다”, “학습률을 낮추면 반복 수와 무관하게 좋아진다”처럼 단정하지 않는다. 손실, 기본학습기, 규제와 데이터 잡음에 따라 편향·분산이 함께 달라진다.

4. 스태킹과 OOF 누수 방지

훈련자료를 K개 폴드로 나눈다. 각 폴드를 한 번씩 제외하고 기본모형을 학습한 뒤 제외 폴드에 예측한다. 모든 제외 폴드의 OOF 예측을 원래 행 순서로 모아 메타모형을 학습한다.

MERMAID코드 영역 안에서 좌우로 이동할 수 있습니다.
flowchart TD
    A["훈련자료 K-fold 분할"] --> B["기본모형별 OOF 예측"]
    B --> C["OOF 행렬로 메타모형 학습"]
    C --> D["기본모형을 전체 훈련자료에 재적합"]
    D --> E["새 자료 기본예측"]
    E --> F["메타모형 최종예측"]

OOF 행렬의 각 행은 그 행을 학습하지 않은 기본모형이 만든 예측이어야 한다. 최종 추론 때는 전체 훈련자료에 다시 적합한 각 기본모형의 새 자료 예측을 동일한 열 순서로 메타모형에 넣는다. 전처리·특징선택·보정도 각 폴드의 훈련 부분에서만 적합해야 한다.

메타모형이 지나치게 복잡하면 OOF 자료에도 과대적합한다. 기본모형의 종류가 달라도 오류가 거의 같으면 이득이 작다. 단순 평균과 단일 기준모형을 같은 분할·지표로 반드시 비교한다.

5. 비모수 분석의 의미와 선택 절차

비모수 분석은 “가정이 전혀 없음”을 뜻하지 않는다. 무작위·독립 표집, 대응 구조, 순위의 비교 가능성, 교환가능성, 차이분포 대칭성 같은 가정이 방법마다 남는다. 자료가 정규분포가 아니라는 이유만으로 자동 선택하지 말고 연구 질문과 설계를 먼저 본다.

질문과 설계대표 비모수 방법핵심 귀무가설·가정모수 대응 예시
독립 두 집단Mann–Whitney U두 분포가 같음; 위치차 해석에는 모양 조건 필요독립표본 t 검정
대응 두 조건Wilcoxon 부호순위쌍별 차이가 0을 중심으로 대칭대응표본 t 검정
대응 두 조건, 차이 대칭성 의심부호검정0이 아닌 차이의 양·음 확률이 같음대응표본 t 검정
독립 세 집단 이상Kruskal–Wallis집단별 분포가 같음일원분산분석
대응 세 조건 이상Friedman조건별 순위 분포가 같음반복측정 분산분석
두 변수의 단조 관계Spearman 순위상관모집단 순위상관이 0Pearson 상관

Mann–Whitney와 Kruskal–Wallis의 유의성을 중앙값 차이라고만 해석하려면 집단 분포 모양과 산포가 비슷한 위치이동 상황 같은 추가 조건이 필요하다. Wilcoxon 부호순위는 쌍별 차이가 대칭이라는 가정이 중요하며, 심하게 비대칭이면 부호검정이나 설계에 맞는 재표본 방법을 검토한다.

Kruskal–Wallis 또는 Friedman의 유의성은 “적어도 한 집단·조건이 다르다”는 전체 판단이다. 어느 쌍이 다른지 알려면 Dunn 검정이나 쌍별 Wilcoxon 등 설계에 맞는 사후비교와 Holm 같은 다중비교 보정이 필요하다.

6. 순위 계산과 효과크기

두 독립 집단 A={1,3,5}, B={2,4,6}을 합쳐 작은 값부터 1~6위를 부여한다. A의 순위는 1, 3, 5이므로 R_A=9, n_A=n_B=3이다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
U_A = R_A - n_A(n_A+1)/2
    = 9 - 3×4/2
    = 3

A_A>B = U_A/(n_A n_B) = 3/9 = 0.333
rank-biserial = 2A_A>B - 1 = -0.333

여기서 정의한 A_A>B는 무작위로 고른 A값이 B값보다 클 확률에 동점의 절반을 더한 값이다. U의 방향 정의를 반대로 쓰는 문헌도 있으므로 어떤 집단을 기준으로 했는지 명시한다. p-value는 U값만 보고 정하지 않고 n_A,n_B, 동점과 정확·점근 분포를 반영한다.

Spearman 상관은 각 변수 값을 순위로 바꾼 뒤 두 순위의 Pearson 상관을 계산한다. 동점이 없을 때만 다음 단축식을 그대로 쓸 수 있다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
ρ_s = 1 - 6Σd_i²/[n(n²-1)]

예를 들어 n=5, 순위차가 [0,1,-1,0,0]이면 Σd_i²=2이고 ρ_s=1-12/(5×24)=0.9다. 동점이 있으면 평균순위를 부여하고 순위 벡터의 상관을 직접 계산한다. 큰 절댓값은 단조 연관성을 뜻하지만 인과관계는 아니다.

7. 정확·점근 검정, permutation과 bootstrap

표본이 작고 동점이 없으면 가능한 순위 배치를 열거하는 정확검정을 사용할 수 있다. 표본이 크면 정규근사를 쓰되 동점·연속성 보정을 방법에 맞게 반영한다. 소프트웨어마다 exact 모드, 0 차이 처리와 양측 p-value 규칙이 다를 수 있어 설정을 기록한다.

방법재배열·재표본 대상주된 목적핵심 조건
순열검정귀무가설 아래 라벨·부호를 재배열검정통계량의 귀무분포와 p-value설계에 맞는 교환가능성
bootstrap관측 단위를 복원추출추정량의 변동·구간 근사표본이 모집단을 대표, 의존 구조 보존
순위검정값의 순위·부호 사용분포 위치·순위 구조 검정독립·대응·대칭 등 검정별 가정

비모수라는 이유만으로 작은 표본에서 검정력이 충분하거나 모든 이상치 문제를 해결하는 것은 아니다. p-value와 함께 효과크기, 호환 가능한 신뢰구간·bootstrap 구간, 원자료 분포와 표본수를 보고한다.

8. 평가·보고와 사례 적용

앙상블은 단일 기준모형과 같은 폴드·기간·집단에서 비교한다. 평균 지표뿐 아니라 폴드별 변동, 희소 클래스 PR-AUC·정밀도·재현율, 확률 보정, 지연시간과 메모리를 확인한다. 결합 가중치와 분류 임계값은 검증자료에서 고정하고 독립 테스트에서 최종 평가한다.

상황: 고객 이탈 예측에서 단일 나무, 랜덤포레스트, 그래디언트 부스팅, 스태킹을 비교하고 동일 고객의 정책 전후 1~5점 만족도를 분석한다.

조건: 이탈은 희소하고 고객별 오류비용이 다르다. 만족도 차이에는 0이 많고 0이 아닌 차이분포의 대칭성이 의심된다.

판단: 고객 단위로 분할해 PR-AUC와 비용가중 손실, 보정·지연시간을 비교한다. 스태킹은 OOF 예측으로 메타모형을 학습하고 단순 평균과 비교한다. 만족도는 대응자료이므로 차이분포와 0을 먼저 확인한다. 대칭성이 합리적이면 Wilcoxon 부호순위, 그렇지 않으면 부호검정 또는 대응 구조를 보존한 재표본 방법을 검토한다. 효과크기와 변화분포를 함께 보고한다.

결론: 앙상블의 복잡성은 누수 없는 성능 향상과 운영비용으로 정당화하고, 전후 차이는 대응 구조·검정 가정·효과크기와 정책 외 시간 요인을 함께 해석한다.

배깅의 병렬 평균, 부스팅의 순차 오류 보정, 스태킹의 폴드 밖 예측과 메타모형을 비교한 구조도
배깅의 병렬 평균, 부스팅의 순차 오류 보정, 스태킹의 폴드 밖 예측과 메타모형을 비교한 구조도
\hat f_bag(x)=(1) ÷ (B)Σ(b=1…B)\hat f^(b)(x)
방법기본모형 관계결합대표 주의
배깅부트스트랩 표본에 병렬 학습평균·투표상관이 높으면 분산 감소 제한
부스팅앞선 오류를 순차 보정가중 합과대적합·노이즈 민감
스태킹여러 후보의 OOF 예측메타모형같은 행 훈련예측 누수 금지
원표본을 복원추출해 계산한 중앙값 2000개의 부트스트랩 분포와 95퍼센트 백분위 구간을 표시한 히스토그램
원표본을 복원추출해 계산한 중앙값 2000개의 부트스트랩 분포와 95퍼센트 백분위 구간을 표시한 히스토그램

부트스트랩은 원표본에서 같은 크기로 복원추출을 반복해 통계량의 표본분포를 근사한다. 시계열·군집 자료처럼 독립 동일분포 가정이 맞지 않으면 블록·군집 부트스트랩 등 의존성을 보존하는 방법을 사용한다.

시험 판단 포인트

  • 평균 앙상블의 효과는 예측기 수뿐 아니라 예측오차 상관에 좌우된다.
  • 크기 n의 부트스트랩 표본에서 한 관측치가 OOB일 확률은 약 36.8%다.
  • 랜덤포레스트는 부트스트랩과 분할 후보 변수 무작위화로 나무 상관을 낮춘다.
  • 부스팅은 순차 갱신이며 학습률이 작으면 보통 더 많은 반복이 필요하다.
  • 스태킹의 메타모형은 OOF 예측으로 학습하고 테스트 라벨을 선택에 쓰지 않는다.
  • 독립·대응 구조와 집단 수를 먼저 확인해 비모수 검정을 선택한다.
  • Wilcoxon 부호순위는 대응 차이의 대칭성, 순열검정은 교환가능성을 확인한다.
  • 전체검정 뒤 사후비교에는 다중비교 보정이 필요하다.

자주 틀리는 부분

  • 나무 수만 늘리면 상관된 오류까지 0이 된다고 보지 않는다.
  • OOB 오차를 시간후행·외부 테스트와 완전히 같다고 보지 않는다.
  • 스태킹의 훈련 적합값을 OOF 예측처럼 사용하지 않는다.
  • Mann–Whitney와 Kruskal–Wallis를 조건 없이 중앙값 검정이라 부르지 않는다.
  • Wilcoxon 부호순위와 독립표본 순위합 검정을 혼동하지 않는다.
  • 전체검정의 유의성만으로 모든 집단쌍이 다르다고 결론내리지 않는다.
  • 유의한 순위상관을 인과효과로 해석하지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01개별 오차분산이 1, 오차 상관이 0.2인 예측기 100개의 평균 앙상블 오차분산은 단순 모형에서 얼마인가?
정답 및 해설

0.208

공통 분산과 상관을 가정한 평균 앙상블 분산은 σ²[ρ+(1-ρ)/B]다. 따라서 1×[0.2+0.8/100]=0.208이다.

02스태킹의 학습·추론 절차로 타당한 내용을 서술하시오.
정답 및 해설

OOF 기본예측으로 메타모형을 학습하고, 전체 훈련자료에 재적합한 기본모형의 새 자료 예측을 메타모형에 넣는다.

각 훈련 행의 메타 입력은 그 행을 학습하지 않은 기본모형의 OOF 예측이어야 한다. 추론용 기본모형은 전체 훈련자료에 재적합하고 새 자료 예측을 학습 때와 같은 열 구조로 메타모형에 전달한다.

03동일 대상의 전후 서열점수에서 0이 아닌 차이분포가 심하게 비대칭일 때 어떻게 판단해야 하는지 근거와 함께 서술하시오.
정답 및 해설

대응성을 유지하고 부호검정 또는 설계에 맞는 재표본 방법을 검토한다.

Wilcoxon 부호순위는 쌍별 차이분포의 대칭성이 중요하다. 심한 비대칭이면 대응 구조를 유지하면서 부호검정이나 타당한 대응 재표본 절차를 검토한다.

04독립된 네 집단의 Kruskal–Wallis 검정이 유의했을 때 적절한 후속 해석을 서술하시오.
정답 및 해설

적어도 한 분포가 다름을 뜻하므로 설계에 맞는 쌍별 사후비교와 다중비교 보정을 수행한다.

Kruskal–Wallis의 유의성은 집단 분포가 모두 같다는 전체 귀무가설에 반대되는 증거다. 어느 쌍이 다른지는 별도 사후비교로 확인하고 가족오류율 등을 통제한다.