현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

분석모형 정의와 구축 절차

문제 정의부터 최종 평가까지 재현 가능한 모형 구축 절차를 익힌다.

예상 읽기 9

핵심 요약

분석모형은 입력 (X)를 출력 (\hat{y})로 바꾸는 통계적·계산적 규칙이다. 전처리, 학습된 상태, 임곗값, 입력 스키마와 버전 정보까지 묶어 실제로 재현·적용할 수 있게 만든 결과물은 모형 패키지(파이프라인 산출물)로 구분해 부르는 편이 정확하다.

구축 순서는 명세 → 분할 → 훈련 범위의 전처리와 학습 → 검증 기반 선택 → 오류·안정성 점검 → 선택 규칙 잠금 → 테스트 1회 평가다. 테스트 결과를 본 뒤 하이퍼파라미터나 임곗값을 바꾸면 그 데이터는 더 이상 독립적인 테스트 데이터가 아니다.

학습 목표

  • 분석모형과 배포 가능한 모형 패키지를 구분한다.
  • 입력·목표·모수·하이퍼파라미터·손실함수·평가지표의 역할을 설명한다.
  • 손실·추정 기준과 이를 계산하는 최적화 알고리즘을 구분한다.
  • 데이터 누출을 막는 구축 절차와 교차검증 파이프라인을 배열한다.
  • 오류 분석과 재현성 기록을 최종 모형 선택에 반영한다.

1. 분석모형을 먼저 명세한다

1.1 모형과 모형 패키지

예측모형은 다음과 같이 쓸 수 있다.

[ \hat{y}=f(X;\theta) ]

여기서 (X)는 예측 시점에 사용할 수 있는 입력, (\theta)는 데이터에서 학습된 상태, (\hat{y})는 예측값·확률·점수다. 회귀계수와 신경망 가중치는 대표적인 모수이고, 의사결정나무의 분할 변수·분할점·구조도 학습된 모형 상태다.

운영 가능한 모형 패키지에는 예측함수만이 아니라 결측 대치·인코딩·스케일링 규칙, 학습된 상태, 분류 임곗값, 입력 스키마, 데이터·코드·라이브러리 버전이 함께 들어간다. 같은 알고리즘이라도 기준 시점, 입력 가능 범위, 전처리 또는 임곗값이 다르면 다른 패키지다.

1.2 명세표

명세 항목반드시 정할 내용예시
업무 의사결정예측으로 바꿀 행동과 오류 비용이탈 고위험 고객에게 유지 제안
분석 단위·기준 시점한 행의 의미와 입력을 끊는 시각고객-매주 월요일 00시
목표·예측 기간무엇을 언제까지 관측할지기준일 이후 30일 내 이탈
입력·출력예측 시점에 이용 가능한 변수와 출력 형식최근 90일 사용량, 이탈 확률
학습 기준손실함수·규제와 최적화 방식로그손실+L2 규제, 수치 최적화
선택 기준평가지표, 임곗값, 제약과 비교 규칙재현율, 비용, 처리 가능 고객 수

목표값이 확정되는 데 시간이 걸리면 라벨 지연을 명시한다. 아직 관측 기간이 끝나지 않은 행을 음성 사례로 처리하면 라벨 오염이 발생할 수 있다.

2. 학습 요소를 구분한다

2.1 모수와 하이퍼파라미터

  • 모수 또는 학습된 상태 (\theta): 훈련 데이터로 추정되는 회귀계수, 나무 구조와 분할, 신경망 가중치 등
  • 하이퍼파라미터: 학습 전에 정하거나 검증으로 선택하는 나무 최대 깊이, 규제 강도, 학습률 등
  • 임곗값: 확률·점수를 행동이나 클래스로 바꾸는 기준이며, 업무 비용과 검증 결과로 선택한다.

하이퍼파라미터와 임곗값을 테스트 결과에 맞춰 고르면 테스트 데이터가 선택 과정에 편입된다.

2.2 손실·추정 기준, 최적화 알고리즘, 평가지표

일반적인 학습 목적은 다음과 같이 나타낼 수 있다.

[ \hat{\theta}=\operatorname*{arg,min}{\theta}\left[\frac{1}{n}\sum{i=1}^{n}L!\left(y_i,f(x_i;\theta)\right)+\lambda\Omega(\theta)\right] ]

단, (n>0), (x_i)는 입력, (y_i)는 목표, (L)은 정의되고 유한한 손실, (\Omega)는 규제항, (\lambda\ge 0)이다. (\lambda=0)이면 규제항을 적용하지 않는다.

구분질문
손실·추정 기준무엇을 작게 또는 크게 만들 것인가?최소제곱, 음의 로그우도, 로그손실
최적화 알고리즘그 기준의 해를 어떻게 계산할 것인가?닫힌형 해법, 경사하강법, 좌표하강법
평가지표목적에 맞게 성능을 어떻게 보고·비교할 것인가?RMSE, 재현율, AUC, 비용

최소제곱과 최대우도는 추정 기준이고, 경사하강법은 그 목적함수의 값을 줄이는 계산 방법이다. 손실함수와 보고 지표는 같을 수도 다를 수도 있다. 예를 들어 로그손실로 확률분류기를 학습하고, 운영 선택에는 재현율과 예상 비용을 함께 사용할 수 있다.

3. 구축 절차

MERMAID코드 영역 안에서 좌우로 이동할 수 있습니다.
flowchart TD
  A["모형 명세 고정"] --> B["데이터 분할"]
  B --> C["훈련 파이프라인과 후보 학습"]
  C --> D["검증·오류 분석·후보 선택"]
  D --> E["최종 파이프라인 잠금"]
  E --> F["테스트 데이터 1회 평가"]
  1. 명세 고정: 업무 의사결정, 분석 단위, 기준 시점, 입력, 목표, 예측 기간, 출력, 손실, 평가지표, 오류 비용과 제약을 기록한다.
  2. 분할: 무작위·집단·시간 분할 중 데이터 생성 구조에 맞는 방식을 정한다. 동일 고객·장비처럼 종속된 행이 여러 집합에 겹치지 않게 관리한다.
  3. 훈련 파이프라인 구성: 결측 대치, 인코딩, 스케일링, 변수 선택과 차원 축소를 훈련 데이터에서만 적합한다.
  4. 기준모형과 후보 학습: 단순 기준모형을 먼저 만들고 사전에 정한 후보와 비교한다.
  5. 검증 기반 선택: 검증 데이터 또는 교차검증으로 하이퍼파라미터와 임곗값을 선택한다. 교차검증에서는 각 폴드의 훈련 부분에서 전처리를 다시 적합한다.
  6. 진단: 오류 유형, 시간·집단별 안정성, 확률 보정, 임곗값 민감도와 필요 시 공정성 위험을 점검한다.
  7. 잠금과 최종 평가: 전처리, 변수, 하이퍼파라미터, 임곗값, 지표 계산 코드를 잠근 뒤 테스트 데이터에서 한 번 평가한다.
  8. 버전 기록: 데이터 스냅숏과 해시, 분할 키·기준일, 코드·라이브러리 버전, 난수 시드와 산출물을 남긴다.

4. 분할 전 확인과 누출 방지

분할 전에 허용할 확인은 파일·스키마·행 수·자료형·값 범위·중복·명백한 형식 오류처럼 목표를 이용하지 않는 구조 점검으로 제한한다. 목표별 요약, 변수 선택, 결측 대치값 계산, 스케일링, 범주 사전 구성처럼 데이터 분포를 학습하는 작업은 훈련 범위 안에서 수행한다.

시간 데이터는 미래 정보가 과거 예측에 들어가지 않도록 기준일을 정하고, 동일 개체의 반복 관측은 집단 또는 시간 구조를 고려해 분할한다. 테스트 결과를 보고 모형을 바꿨다면 새로운 독립 테스트 자료가 있어야 변경 후 일반화 성능을 다시 주장할 수 있다.

5. 재현 가능한 파이프라인

파이프라인은 다음을 하나의 버전으로 관리한다.

  • 원천 컬럼, 자료형, 허용 범위와 최종 변수 순서
  • 결측 대치 통계량, 범주 수준과 미등록 범주 처리
  • 파생변수의 기준일·집계 창, 스케일링·차원 축소 상태
  • 학습된 모형 상태, 하이퍼파라미터와 분류 임곗값
  • 데이터 스냅숏·해시, 분할 키·기준일, 코드·라이브러리 버전
  • 난수 시드, 평가지표 계산 코드와 후보 선택 규칙

학습과 예측에서 같은 변환 코드를 사용하고 입력·출력 스키마를 검증한다. 재현성은 단지 난수 시드를 적는 것이 아니라 같은 데이터와 환경에서 같은 선택 과정을 다시 실행할 수 있게 하는 것이다.

6. 오류 분석과 진단

전체 평균 점수와 함께 다음을 확인한다.

  • 시간·지역·고객군별 표본 수와 성능
  • 큰 오차와 반복되는 오분류 유형
  • 라벨 오류, 결측, 새 범주와 분포 변화의 영향
  • 확률 보정과 임곗값 변화에 따른 비용·재현율
  • 훈련·검증 격차, 학습 곡선과 과대적합 징후
  • 설명변수의 예상치 못한 대리 효과와 집단별 위험

오류 원인을 데이터 품질, 라벨 정의, 변수 부족, 모형 가정 또는 의사결정 규칙으로 나눈다. 일부 테스트 사례를 보고 임의 규칙을 추가하면 테스트 데이터에 과적합할 수 있다.

7. 사례 적용: 통신 이탈 예측

상황: 통신사가 매주 고객의 다음 30일 이탈 확률을 계산해 유지 제안 대상을 정한다.

명세: 고객-기준일을 분석 단위로 하고, 기준일 이후 30일 내 확정된 이탈을 목표로 삼는다. 입력은 기준일까지 확정된 최근 90일 사용·상담 정보로 제한한다. 30일 관측 창이 끝나지 않은 행은 학습 라벨에서 제외하거나 별도로 관리한다.

분할과 학습: 운영 순서를 모사하도록 과거를 훈련, 이후 기간을 검증·테스트로 나눈다. 같은 고객의 중복 또는 인접 관측이 성능을 부풀리지 않도록 집단과 시간 겹침을 점검한다. 결측 대치와 집계 변환은 각 훈련 창에서 적합하고 기준 로지스틱 회귀와 후보 모형을 비교한다.

선택과 평가: 검증 범위에서 하이퍼파라미터, 임곗값, 비용 기준을 확정하고 지역·가입기간별 재현율과 보정을 확인한다. 모든 규칙을 잠근 뒤 테스트 기간을 한 번 평가한다.

오답 함정: 기준일 뒤에 확정되는 해지 처리일을 입력하거나, 테스트 점수를 보며 임곗값을 반복 조정하면 미래정보 누출 또는 테스트 오염이 발생한다.

문제와 평가 정의부터 데이터 파이프라인, 기준모형, 후보 학습, 독립 검증과 운영 이관으로 이어지는 생명주기
문제와 평가 정의부터 데이터 파이프라인, 기준모형, 후보 학습, 독립 검증과 운영 이관으로 이어지는 생명주기

각 단계는 산출물과 승인 조건을 가진다. 검증 결과로 후보를 고른 뒤 잠긴 테스트를 마지막에 열며, 운영 이관에는 코드·데이터·환경 버전과 모니터링 조건이 필요하다.

기준모형과 복잡한 후보를 성능 개선, 운영 비용, 설명 가능성, 반복 안정성 게이트로 비교하는 구조도
기준모형과 복잡한 후보를 성능 개선, 운영 비용, 설명 가능성, 반복 안정성 게이트로 비교하는 구조도
게이트질문탈락 예
성능기준모형보다 일관되게 좋은가평균 차이가 작고 변동이 큼
운영지연·비용·메모리를 만족하는가SLA 초과
설명·통제결과를 감사하고 재현할 수 있는가입력·버전 추적 불가
안정성시드·기간·집단이 달라도 견고한가특정 구간에만 우수

검증 점수 하나가 최종모형을 자동 결정하지 않는다. 시험에서는 기준모형과 외부 평가 조건을 같게 둔다는 원칙을 확인한다.

시험 판단 포인트

  • 분석모형의 학습 규칙과 운영 가능한 모형 패키지를 구분한다.
  • 최소제곱·최대우도는 추정 기준이고 경사하강법은 최적화 알고리즘이다.
  • 모수·학습 상태는 훈련 데이터에서 추정하고, 하이퍼파라미터와 임곗값은 검증으로 선택한다.
  • 전처리·변수 선택은 훈련 범위에서 적합하며 교차검증에서는 폴드 내부에서 다시 적합한다.
  • 테스트 데이터는 모든 선택과 코드를 잠근 뒤 최종 일반화 성능을 한 번 확인한다.

자주 틀리는 부분

  • 분할 전 구조 점검과 목표를 이용한 탐색·전처리 학습을 같은 것으로 보지 않는다.
  • 손실함수, 최적화 알고리즘, 평가지표를 서로 바꾸어 부르지 않는다.
  • 테스트 성능을 확인하며 후보·하이퍼파라미터·임곗값을 바꾸지 않는다.
  • 난수 시드만 기록하면 재현성이 확보된다고 보지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01하이퍼파라미터에 해당하는 내용을 쓰시오.
정답 및 해설

검증으로 선택한 나무 최대 깊이

나무 최대 깊이는 학습 전에 정하거나 검증 성능으로 선택하는 하이퍼파라미터다.

02테스트 데이터의 올바른 사용은?
정답 및 해설

모든 선택을 잠근 모형의 일반화 성능을 한 번 평가한다.

테스트 데이터는 전처리, 후보, 하이퍼파라미터, 임곗값과 지표 계산을 모두 잠근 뒤 일반화 성능을 한 번 확인하는 독립 자료다.

03손실·추정 기준과 최적화 알고리즘의 관계를 바르게 연결하여 설명하시오.
정답 및 해설

로그손실은 최소화할 기준이고, 경사하강법은 이를 줄이는 계산 방법이다.

로그손실은 최소화할 목적이고 경사하강법은 목적함수의 값을 줄여 해를 찾는 최적화 알고리즘이다.

04시간 순서가 있는 고객 이탈 예측에서 적절한 절차를 순서대로 서술하시오.
정답 및 해설

과거를 훈련하고 이후를 검증·테스트로 두며 전처리를 각 훈련 범위에서 적합한다.

시간 분할은 운영 시점의 미래 예측을 모사하고, 전처리를 훈련 범위에서 적합해야 미래정보 누출을 막을 수 있다.