분석모형 선정과 문제 유형
문제 유형과 제약을 바탕으로 기준모형과 후보모형을 선정한다.
핵심 요약
분석모형을 고르는 순서는 문제 정의 → 평가 기준 설정 → 후보 비교 → 운영 적합성 확인이다. 연속값을 예측하면 회귀, 범주나 확률을 예측하면 분류, 라벨 없이 비슷한 관측치를 묶으면 군집, 함께 발생하는 항목 규칙을 찾으면 연관성분석에 가깝다.
시계열은 회귀·분류와 서로 배타적인 문제 유형이 아니라 시간 순서가 중요한 데이터 구조다. 다음 주 판매량 예측은 시계열 구조를 가진 회귀이고, 다음 달 연체 여부 예측은 시계열 구조를 가진 분류가 될 수 있다. 이상탐지도 라벨 상황에 따라 지도 분류, 정상 데이터 중심의 단일 클래스 학습, 비지도 탐지로 설계할 수 있다.
학습 목표
- 분석 단위·목표변수·예측 기준 시점을 정의한다.
- 회귀·분류·군집·연관성분석·이상탐지를 라벨과 출력 기준으로 구분한다.
- 시계열을 별도 알고리즘 이름이 아니라 시간 의존성을 가진 문제 구조로 설명한다.
- 성능, 오류 비용, 해석성, 처리 시간과 운영 제약으로 후보 모형을 비교한다.
- 기준모형과 후보를 데이터 누수 없이 공정하게 비교한다.
0. 먼저 알아둘 용어
- 분석 단위: 한 행 또는 한 번의 예측이 무엇을 뜻하는지 나타낸다. 예를 들어
고객-월,상품-점포-일처럼 정의한다. - 목표변수: 모형이 최종적으로 예측하거나 설명하려는 값이다.
- 라벨: 학습 데이터에서 이미 알고 있는 목표변수의 관측값이다.
- 예측 기준 시점: 실제 운영에서 예측을 실행하는 시점이다. 입력변수는 이 시점에 이용 가능해야 한다.
- 기준모형: 복잡한 후보가 실제로 개선됐는지 판단하기 위한 단순한 비교 기준이다.
1. 라벨과 출력으로 문제 유형 구분하기
| 문제 유형 | 목표 라벨 | 주된 출력 | 학습 방식과 판단 기준 |
|---|---|---|---|
| 회귀 | 있음 | 연속형 수치 | 지도학습. 매출액·수요량·온도처럼 크기를 예측한다. |
| 분류 | 있음 | 범주 또는 범주별 확률 | 지도학습. 이탈 여부·등급·고장 유형을 예측한다. |
| 군집 | 없음 | 군집 번호와 군집별 특성 | 비지도학습. 유사도나 거리를 이용해 구조를 발견한다. |
| 연관성분석 | 특정 목표 라벨 없음 | 항목 간 동시발생 규칙 | 비지도 패턴 탐색. 지지도·신뢰도·향상도와 활용성을 함께 본다. |
| 이상탐지 | 있을 수도, 없을 수도 있음 | 이상 점수 또는 이상 여부 | 라벨이 충분하면 지도 분류, 정상 자료만 있으면 단일 클래스, 라벨이 없으면 비지도 탐지를 고려한다. |
| 시계열 회귀·분류 | 과거 자료에서 구성 가능 | 미래 값·범주·확률 | 시간 순서와 지연 관계가 핵심이다. 무작위 분할 대신 시간 순서를 지킨 검증을 사용한다. |
문제 유형은 알고리즘 이름이 아니라 업무 질문과 출력에서 시작한다. 같은 고객 데이터라도 다음 달 지출액을 예측하면 회귀, 일정 금액 이상 지출할지를 예측하면 분류, 고객 행동 유형을 발견하면 군집이다.
시계열이라는 이유만으로 항상 연속값을 예측하는 것은 아니다. 시간 순서가 있는 자료로 미래 고장 여부를 예측하면 분류다. 반대로 판매량을 예측하더라도 시간 의존성이 거의 없고 독립적인 설명변수 중심이라면 일반 회귀 설계가 더 적합할 수 있다.
2. 모형 선정의 다섯 축
2.1 업무 목표, 분석 단위, 예측 기준 시점
먼저 예측 결과가 어떤 의사결정을 바꾸는지 정한다. 고객 이탈 예측만으로는 부족하다. 매월 1일 고객별로 다음 30일 내 이탈 확률을 계산해 상담 대상 1,000명을 고른다처럼 분석 단위, 기간, 사용 방법을 명확히 해야 한다.
목표변수는 예측 기준 시점 이후에 확정될 수 있지만 입력변수는 예측 순간에 확보할 수 있어야 한다. 해지 완료일, 수리 결과처럼 미래에 생기는 정보를 입력에 넣으면 데이터 누수가 발생한다.
2.2 라벨과 출력 형태
- 연속형 수치가 필요하면 회귀를 우선 검토한다.
- 범주 또는 사건 발생 확률이 필요하면 분류를 검토한다.
- 목표 라벨 없이 구조를 발견하려면 군집이나 연관성분석을 검토한다.
- 이상 라벨의 양과 신뢰도에 따라 지도·단일 클래스·비지도 이상탐지를 구분한다.
2.3 데이터 구조와 품질
표본 수와 변수 수, 수치형·범주형·텍스트·이미지의 비율, 결측과 이상값, 클래스 불균형, 비선형성과 상호작용을 확인한다. 같은 사람의 반복 측정, 시간 순서, 공간 인접성처럼 관측치 사이의 의존성도 검증 설계에 반영해야 한다.
2.4 평가 기준과 오류 비용
모형의 평균 성능만 보지 말고 어떤 오류가 더 비싼지 확인한다. 제곱오차 계열은 큰 오차에 더 큰 벌점을 주고, 절대오차 계열은 오차 크기에 비례해 선형적으로 벌점을 준다. 희귀 고장 탐지에서는 전체 정확도가 높아도 고장을 대부분 놓칠 수 있으므로 재현율, 정밀도, 거짓 경보 처리량과 비용을 함께 본다.
2.5 운영 제약
예측 지연시간, 메모리, 재학습 주기, 설명 가능성, 규제·감사 요구, 입력변수 확보 비용, 담당자의 유지보수 역량을 고려한다. 검증 점수가 조금 높은 복잡한 모형보다 안정적이고 설명 가능한 모형이 실제 운영에서는 더 적합할 수 있다.
3. 기준모형과 후보군 만들기
| 업무 목표 | 기준모형 예시 | 후보모형 예시 | 최종 비교에서 볼 것 |
|---|---|---|---|
| 연속값 예측 | 평균·중앙값, 단순 선형회귀 | 규제 회귀, 나무 기반 회귀 | MAE·RMSE와 큰 오차의 업무 비용 |
| 범주 예측 | 다수 클래스, 과거 발생률, 로지스틱 회귀 | 의사결정나무, SVM, 앙상블 | 재현율·정밀도·임곗값과 오류 비용 |
| 시간 순서가 있는 예측 | 직전 값, 계절 동일 시점 | 시계열 모형, 시간 변수를 반영한 회귀·분류 | 시간 순서 검증, 예측 구간별 안정성 |
| 고객군 발견 | 기존 업무 규칙에 따른 단순 세분 | k-평균, 계층적 군집 | 응집도·분리도, 반복 안정성, 활용 가능성 |
| 동시구매 규칙 발견 | 개별 품목 빈도 | 연관규칙 탐색 | 지지도·신뢰도·향상도와 실행 가능성 |
군집의 단순 세분 규칙은 정답 모형이 아니라 업무상 참고 기준이다. 군집은 정답 라벨이 없으므로 분류 정확도만으로 평가하지 않는다. 내부 품질, 다른 표본에서도 비슷하게 재현되는지, 실제 의사결정에 쓸 수 있는지를 함께 확인한다.
후보마다 필요한 전처리는 다를 수 있다. 중요한 것은 모든 후보에 똑같은 변환을 강요하는 것이 아니라 다음 외부 평가 조건을 같게 유지하는 것이다.
- 같은 분석 단위, 목표 정의와 대상 모집단을 사용한다.
- 같은 훈련·검증·테스트 구간과 평가 지표를 사용한다.
- 결측치 처리·스케일링·변수 선택은 각 후보의 학습 파이프라인 안에서 훈련 데이터로만 적합한다.
- 하이퍼파라미터와 임곗값은 검증 데이터에서 정하고 테스트 데이터는 최종 확인에만 사용한다.
- 무작위성이 있는 모형은 필요하면 여러 시드에서 안정성을 확인한다.
4. 분석모형 선정 절차
- 업무 의사결정과 성공 기준을 문장으로 적는다.
- 분석 단위, 목표변수와 예측 기준 시점을 정의한다.
- 라벨 유무, 출력 형태와 시간·그룹 구조를 확인한다.
- 오류 비용을 반영한 평가 지표와 검증 방법을 정한다.
- 기준모형과 복수 후보를 구성한다.
- 학습 파이프라인을 분리해 데이터 누수를 막고 같은 외부 조건에서 비교한다.
- 성능뿐 아니라 설명성, 지연시간, 안정성과 유지보수성을 확인해 최종 후보를 정한다.
선정 과정에서 분석 목표가 달라지면 앞 단계로 돌아가야 한다. 알고리즘을 먼저 고른 뒤 업무 질문을 끼워 맞추면 평가 지표와 실제 의사결정이 어긋날 수 있다.
5. 사례 적용
상황: 유통회사가 다음 주 재고 부족을 줄이고 고객군별 판촉도 개선하려 한다.
가용 데이터: 상품-점포-일자별 판매량과 재고, 고객별 거래 이력이 있다. 고객군 정답 라벨은 없다.
문제 분리
- 다음 주 상품별 판매량: 시간 구조를 가진 회귀 문제
- 다음 주 품절 발생 여부: 시간 구조를 가진 분류 문제
- 비슷한 고객 행동 집단 발견: 비지도 군집 문제
- 함께 구매되는 상품 묶음 발견: 연관성분석 문제
평가 설계: 판매량은 MAE·RMSE와 품절 비용, 품절 분류는 재현율·거짓 경보 처리량, 군집은 안정성과 판촉 활용성, 연관규칙은 지지도·신뢰도·향상도와 실행 가능성을 본다. 모두를 하나의 정확도로 비교하지 않는다.
후보 선정: 판매량에는 계절 동일 시점 값을 기준모형으로 두고 시계열 후보를 비교한다. 고객군에는 기존 마케팅 세분 규칙을 참고 기준으로 두고 군집 후보의 안정성과 해석 가능성을 비교한다.
결론: 같은 데이터라도 업무 질문별로 목표, 출력, 기준모형과 평가 지표를 분리해야 한다.
기존 본문의 분석모형 선정 흐름은 업무 질문을 먼저 고정하고 후보를 비교하는 순서를 보여 준다. 알고리즘 이름보다 분석 단위·목표·예측 시점·오류 비용이 앞선다는 점이 핵심이다.
| 라벨·출력 | 대표 문제 | 시험 판단 기준 |
|---|---|---|
| 라벨 있음·연속값 | 회귀 | 값의 크기 예측 |
| 라벨 있음·범주·확률 | 분류 | 사건·등급 예측 |
| 라벨 없음·관측치 집단 | 군집 | 거리·유사도 기반 구조 |
| 라벨 없음·항목 규칙 | 연관성분석 | 동시발생 규칙 |
시계열은 회귀·분류와 배타적인 문제가 아니라 시간 의존성을 가진 자료 구조다. 시험에서는 목표 라벨과 출력의 형태를 먼저 찾아 문제 유형을 판별한다.
시험 판단 포인트
- 연속형 목표는 회귀, 범주형 목표는 분류다.
- 군집과 연관성분석은 특정 목표 라벨 없이 구조나 규칙을 찾는다.
- 시계열은 회귀·분류와 교차하는 시간 구조이므로 시간 순서를 지켜 검증한다.
- 모형 선정에는 성능뿐 아니라 오류 비용, 해석성, 지연시간, 안정성과 유지보수성이 포함된다.
- 후보별 전처리는 달라도 되지만 훈련 데이터에서만 적합하고 같은 외부 평가 조건을 사용해야 한다.
- 기준모형은 복잡한 후보가 단순한 방법보다 실제 가치를 더하는지 확인하는 비교점이다.
자주 틀리는 부분
- 유명하거나 복잡한 알고리즘이 모든 데이터에서 최선이라고 단정하지 않는다.
- 시계열을 회귀·분류와 완전히 별개의 출력 유형으로 보지 않는다.
- 군집 번호를 실제 정답 범주로 간주해 분류 정확도로만 평가하지 않는다.
- 절대오차를
모든 오차에 같은 벌점으로 해석하지 않는다. 오차의 크기에 비례해 벌점이 커진다. - 후보마다 전처리가 다르다는 이유로 평가 대상이나 테스트 구간까지 다르게 두지 않는다.
- 예측 기준 시점 이후에 생성되는 사후 변수를 입력에 포함하지 않는다.
개념 확인 문제
문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.
01다음 주 상품별 판매량을 예측하며 날짜 순서가 중요한 경우 알맞게 설명하시오.
시간 구조를 가진 회귀 문제다.
판매량은 연속형 수치이므로 회귀이고 날짜 순서가 중요하므로 시간 구조를 반영해야 한다.
02목표 라벨 없이 장바구니에서 함께 나타나는 상품 규칙을 찾으려 한다. 가장 적절한 문제 유형은?
연관성분석
특정 목표 라벨 없이 함께 등장하는 상품 규칙을 찾으므로 연관성분석이다.
03여러 후보모형을 공정하게 비교하는 방법을 서술하시오.
같은 목표·평가 구간·지표를 사용하되, 후보별 전처리는 각 훈련 파이프라인 안에서 적합한다.
외부 평가 조건은 같게 유지하고 후보별 전처리는 훈련 데이터 안에서 각각 적합해야 한다.
04희귀 설비 고장 탐지 모형의 선정 기준으로 타당한 내용을 서술하시오.
고장 누락 비용, 거짓 경보 비용과 처리 가능한 경보량을 함께 반영한다.
희귀 사건은 전체 정확도가 높아도 중요한 고장을 놓칠 수 있으므로 누락·거짓 경보 비용과 운영 처리량을 함께 본다.