ROC·AUC와 임곗값 선택
ROC·AUC의 의미를 이해하고 비용·용량에 맞는 임곗값을 정한다.
핵심 요약
확률이나 연속 점수를 출력하는 이진분류모형은 양성 판정 임곗값에 따라 혼동행렬이 달라진다. ROC 곡선은 임곗값을 바꿀 때의 위양성률(FPR)을 가로축, 재현율(TPR)을 세로축에 표시한다. 임곗값을 낮추면 양성 예측 집합이 커지므로 TPR과 FPR은 감소하지 않는다.
ROC-AUC는 모든 임곗값에서의 순위 구분 능력을 하나의 값으로 요약한다. 경험적 AUC는 임의의 양성이 임의의 음성보다 높은 점수를 받을 확률로 해석할 수 있고, 동점은 절반으로 센다. AUC는 확률 보정이나 특정 운영 임곗값의 정밀도·비용·경보 수를 보장하지 않는다. 양성이 희소한 업무에서는 PR 곡선, 기준 양성 비율, 절대 경보 수, 오류 비용과 처리 용량을 함께 사용해 임곗값을 정한다.
학습 목표
- TPR과 FPR의 분모 및 ROC 축을 정확히 구분한다.
- 임곗값 변화와 ROC의 시작점·끝점을 설명한다.
- ROC 점들로 AUC를 계산하고 순위 확률 의미와 연결한다.
- ROC-AUC, PR 곡선, 평균정밀도(AP)와 확률 보정을 구분한다.
- 기준 양성 비율로 TP·FP·경보 수·정밀도를 계산한다.
- 오류 비용·최소 성능·처리 용량·검증 절차로 운영 임곗값을 선택한다.
1. 양성 클래스, 점수와 ROC 좌표
먼저 관심 대상을 양성 클래스로 고정한다. 사기 탐지라면 사기 거래를 양성으로 두고, 점수 s가 임곗값 t 이상일 때 양성으로 예측한다고 하자.
양성 예측 조건: s ≥ t
TPR = 재현율 = TP / (TP + FN)
FPR = FP / (FP + TN) = 1 - 특이도
ROC 좌표 = (FPR, TPR)
TPR의 분모는 실제 양성 수, FPR의 분모는 실제 음성 수다. FP/(TP+FP)는 FPR이 아니라 1-정밀도이므로 혼동하지 않는다.
| 임곗값 변화 | 양성 예측 집합 | TP·FP | TPR | FPR |
|---|---|---|---|---|
| 높임 | 작아짐 | 감소 또는 유지 | 감소 또는 유지 | 감소 또는 유지 |
| 낮춤 | 커짐 | 증가 또는 유지 | 증가 또는 유지 | 증가 또는 유지 |
임곗값을 모든 점수보다 높이면 아무것도 양성으로 예측하지 않아 ROC는 (0, 0)에서 시작한다. 모든 점수보다 낮추면 모두 양성으로 예측해 (1, 1)에 도달한다. 유한 표본과 동점 때문에 곡선은 계단 모양이 될 수 있다. 같은 데이터와 양성 클래스에서 임곗값을 낮춰 가는데 TPR 또는 FPR이 감소한다면 계산 순서나 라벨 방향을 확인한다.
2. AUC의 의미와 해석 조건
ROC-AUC는 ROC 곡선 아래 면적이며 보통 0~1 범위다. 실제 양성과 실제 음성이 모두 존재해야 ROC와 AUC를 정의할 수 있다.
AUC = 1: 모든 양성 점수가 모든 음성 점수보다 높다.AUC = 0.5: 무작위 순위와 같은 수준이다. 모든 점수가 같아도 동점을 절반으로 처리하면 0.5다.AUC < 0.5: 점수 방향이 반대이거나 양성 라벨·평가 설정을 잘못 지정했을 가능성을 확인한다.
경험적 AUC는 양성·음성 점수 쌍을 비교한 비율로 해석할 수 있다. 양성이 더 높으면 1, 동점이면 0.5, 낮으면 0을 부여한다. 이 해석은 순위에 관한 것이다. 점수에 단조 증가 변환을 적용해 순위가 같으면 AUC도 같지만, 0.5 같은 고정 임곗값의 결과와 확률 보정은 달라질 수 있다.
FPR이 오름차순인 ROC 점 (x_i, y_i)를 직선으로 연결하면 사다리꼴 공식으로 면적을 계산할 수 있다.
AUC = Σ[(x_(i+1) - x_i) × (y_i + y_(i+1)) / 2]
경험적 순위 AUC
= (양성 점수가 더 높은 쌍 수 + 0.5 × 동점 쌍 수)
/ (양성 수 × 음성 수)
AUC 계산 예시
양성 점수는 0.90, 0.80, 0.70, 0.40, 음성 점수는 0.75, 0.60, 0.30, 0.20이라고 하자. 임곗값을 낮춰 관측치를 한 건씩 양성 예측에 포함하면 다음 ROC 점을 얻는다.
| 임곗값 직후 | 새로 포함된 실제 클래스 | FPR | TPR |
|---|---|---|---|
+∞ | 없음 | 0.00 | 0.00 |
| 0.90 | 양성 | 0.00 | 0.25 |
| 0.80 | 양성 | 0.00 | 0.50 |
| 0.75 | 음성 | 0.25 | 0.50 |
| 0.70 | 양성 | 0.25 | 0.75 |
| 0.60 | 음성 | 0.50 | 0.75 |
| 0.40 | 양성 | 0.50 | 1.00 |
| 0.30 | 음성 | 0.75 | 1.00 |
| 0.20 | 음성 | 1.00 | 1.00 |
사다리꼴 면적은 0.125 + 0.15625 + 0.25 + 0.25 + 0.03125 = 0.8125다. 순위 비교에서도 양성·음성 16쌍 중 양성 점수가 더 높은 쌍이 13개이고 동점이 없으므로 13/16 = 0.8125로 일치한다.
3. 한 임곗값의 ROC 좌표와 정밀도
한 임곗값에서 TP=36, FN=4, FP=90, TN=870이 관측되었다.
TPR = 36 / (36 + 4) = 0.900
FPR = 90 / (90 + 870) = 0.09375
특이도 = 1 - 0.09375 = 0.90625
정밀도 = 36 / (36 + 90) = 0.285714...
ROC 좌표는 (0.09375, 0.900)이다. 실제 양성의 90%를 찾지만 양성 예측 126건 중 실제 양성은 36건뿐이므로 정밀도는 약 28.6%다. 한 점은 특정 임곗값의 운영 결과일 뿐이며, 한 점만으로 AUC를 계산하지 않는다.
4. ROC와 PR을 함께 보는 이유
PR 곡선은 임곗값별 재현율과 정밀도의 관계를 나타낸다. ROC의 FPR은 실제 음성 수를 분모로 사용하므로 음성이 매우 많을 때 작은 FPR도 많은 FP를 만들 수 있다. ROC가 틀린 것은 아니지만, ROC만으로는 양성 예측 중 실제 양성이 차지하는 비율과 조사 부담이 드러나지 않는다.
| 관점 | ROC 곡선 | PR 곡선 |
|---|---|---|
| 축 | FPR, TPR | 재현율, 정밀도 |
| 주된 질문 | 양성과 음성의 점수 순위를 얼마나 구분하는가? | 양성을 얼마나 찾으며 양성 예측은 얼마나 믿을 만한가? |
| 무작위 기준 | ROC-AUC 0.5 | 정밀도 기준선은 양성 비율 π |
| 희소 양성 업무 | 낮은 FPR 구간과 절대 FP 수 확인 | FP 부담과 양성 희소성이 직접 반영됨 |
양성 비율을 π, 전체 건수를 N이라고 하면 한 운영점의 예상 건수를 다음처럼 바꿀 수 있다.
예상 TP = N × π × TPR
예상 FP = N × (1 - π) × FPR
예상 경보 수 = TP + FP
예상 정밀도 = π × TPR / [π × TPR + (1 - π) × FPR]
분모가 0이면 정밀도는 정의되지 않는다. 또한 실제 양성이 없으면 TPR과 ROC-AUC가, 실제 음성이 없으면 FPR과 ROC-AUC가 정의되지 않는다. 분석 도구가 이런 경우 0, NaN 또는 오류를 반환할 수 있으므로 클래스 건수와 처리 규칙을 함께 보고한다.
PR-AUC라는 표현은 구현에 따라 의미가 모호할 수 있다. 평균정밀도(AP)는 보통 재현율 증가분으로 정밀도를 가중해 합산하고, PR 점들을 직선으로 연결한 사다리꼴 면적과 값이 다를 수 있다. 모형을 비교할 때는 AP인지 보간된 PR 면적인지 정의, 도구와 양성 비율을 통일한다.
5. 운영 임곗값 선택
AUC가 임곗값을 정해 주지는 않는다. 다음 순서로 선택한다.
- 양성 클래스, 평가 기간과 데이터 단위를 고정한다.
- 최소 재현율·최소 정밀도·최대 FPR·최대 경보 수 같은 제약을 수치로 정한다.
- 검증 데이터의 각 임곗값에서 TP·FP·FN·TN, 경보 수와 비용을 계산한다.
- 모든 필수 제약을 만족하는 후보 중 비용 또는 효용이 가장 좋은 임곗값을 고정한다.
- 고정된 임곗값을 독립 테스트 데이터에서 한 번 평가한다.
- 운영 중 양성 비율·비용·처리 용량·점수 분포가 바뀌면 재검토한다.
오류 비용이 C_FP, C_FN일 때 단순 기대비용 후보는 다음과 같다. 실제 업무에서는 조사 인력, 고객 불편, 차단 손실 등 비용의 근거와 단위를 명시한다.
총 오류비용 = C_FP × FP + C_FN × FN
용량 제약 = TP + FP ≤ 최대 처리 건수
Youden 지수 J = TPR - FPR
Youden 지수는 TPR과 특이도를 같은 비중으로 보는 후보를 줄이지만 FP와 FN 비용이 다르거나 양성 비율·용량 제약이 중요하면 최종 기준으로 그대로 사용하지 않는다. 검증 데이터에서 임곗값을 반복 최적화한 뒤 같은 데이터를 최종 성능처럼 보고하면 선택 편향이 생긴다.
6. 희소 양성 사례: 비율을 경보 수로 바꾸기
하루 N=1,000,000건 중 양성 비율이 π=0.001이면 실제 양성은 1,000건, 실제 음성은 999,000건이다. 조사 용량은 하루 2,000건이고 누락 비용을 C_FN=100, 오경보 비용을 C_FP=1로 가정한다.
| 후보 | TPR | FPR | 예상 TP | 예상 FP | 경보 수 | 정밀도 | 오류비용 | 용량 충족 |
|---|---|---|---|---|---|---|---|---|
| A | 0.80 | 0.001 | 800 | 999 | 1,799 | 44.5% | 20,999 | 충족 |
| B | 0.90 | 0.002 | 900 | 1,998 | 2,898 | 31.1% | 11,998 | 미충족 |
B는 재현율이 높고 단순 오류비용도 낮지만 조사 용량을 초과한다. 주어진 제약에서는 A가 실행 가능한 후보다. 용량을 늘리거나 경보를 2단계로 분류할 수 있다면 B를 다시 검토할 수 있다. 이 예시는 FPR의 작은 차이가 음성 999,000건에 적용될 때 약 999건의 FP 차이로 확대됨을 보여준다.
7. AUC를 단독 사용하면 안 되는 상황
- 업무가 매우 낮은 FPR 구간만 허용하는데 전체 ROC-AUC로 모형을 비교함
- 두 ROC 곡선이 교차하는데 AUC 하나만 보고 필요한 운영 구간의 우열을 무시함
- 양성 비율 변화로 정밀도와 절대 경보 수가 크게 달라짐
- 순위는 좋지만 예측확률 보정이 나빠 비용 기반 의사결정이 흔들림
- 동일 사용자·시간 정보·전처리 누수로 평가 점수가 과대평가됨
- 집단 평균 AUC가 집단별 TPR·FPR 차이를 숨김
- 두 모형의 AUC 점추정치 차이가 작지만 표본 불확실성을 확인하지 않음
필요하면 허용 FPR 구간의 부분 AUC, 상위 k건 재현율, PR 곡선·AP, 비용곡선, 보정곡선과 집단별 운영점을 추가한다. 표본에서 추정한 AUC는 확정값이 아니므로 유사한 모형을 비교할 때는 같은 독립 평가자료와 신뢰구간 또는 짝지은 재표본화 결과를 함께 본다.
8. 다중분류에서의 확장
다중분류 ROC-AUC는 하나의 자연스러운 양성 클래스가 없으므로 이진분류 방식의 확장 규칙을 명시해야 한다.
| 방식 | 원리 | 주의점 |
|---|---|---|
| 일대다(OvR) | 각 클래스를 양성, 나머지를 음성으로 계산 | 클래스별 불균형의 영향을 받음 |
| 일대일(OvO) | 클래스 쌍별 AUC를 계산해 결합 | 클래스 쌍과 평균 규칙을 명시 |
| Macro 평균 | 클래스별 AUC를 같은 비중으로 평균 | 소수 클래스도 동일한 비중 |
| Weighted 평균 | 실제 클래스 수로 가중 평균 | 다수 클래스의 영향이 커짐 |
서로 다른 OvR·OvO 규칙이나 평균 방식을 사용한 AUC는 직접 비교하지 않는다. 각 클래스 점수가 무엇을 의미하는지와 양성 라벨 방향도 확인한다.
9. 시험 판단 포인트
- ROC의 가로축은 FPR, 세로축은 TPR이다.
- FPR의 분모는 실제 음성 수이며
1-특이도다. - 임곗값을 낮추면 같은 표본에서 TPR과 FPR은 감소하지 않는다.
- ROC는
(0,0)에서 시작해(1,1)로 끝난다. - AUC는 임곗값 전반의 순위 구분 능력이지 확률 보정이나 운영 임곗값 성능이 아니다.
- 한 임곗값의 ROC 점만으로 AUC를 계산하지 않는다.
- 희소 양성에서는 PR 곡선·정밀도·절대 경보 수와 양성 비율을 함께 본다.
- AP와 사다리꼴 PR 면적은 계산 정의가 다를 수 있다.
- 운영 임곗값은 최소 성능, 오류 비용, 처리 용량을 검증 데이터에서 비교하고 테스트 데이터에서 한 번 확인한다.
자주 틀리는 부분
- 위양성률을
FP/(TP+FP)로 계산한다. - ROC 축을 바꾸거나 임곗값을 낮출 때 TPR이 감소한다고 판단한다.
- AUC가 높으면 기본 임곗값
0.5가 최적이라고 단정한다. - AUC를 예측확률의 정확성이나 실제 양성 비율로 해석한다.
- 양성이 드문데 낮은 FPR만 보고 절대 FP 수와 정밀도를 계산하지 않는다.
PR-AUC와 AP를 정의 확인 없이 같은 값으로 취급한다.- ROC 곡선이 교차하는데 전체 AUC만으로 필요한 운영 구간의 모형을 고른다.
- 검증 데이터로 임곗값을 고른 뒤 같은 데이터의 성능을 독립 테스트 결과처럼 보고한다.
참양성률과 거짓양성률은 다음과 같이 정의한다.
ROC의 한 점은 하나의 임곗값에서 얻은 (FPR, TPR)이고, 곡선은 여러 임곗값의 운영점을 연결한다. 왼쪽 위에 가까울수록 같은 FPR에서 TPR이 높지만, AUC는 특정 임곗값의 비용이나 정밀도를 직접 알려 주지 않는다.
임곗값 0.6은 이 예시에서 정밀도 0.80과 재현율 0.69의 운영점 후보다. 시험에서는 “AUC가 가장 큰 모형 선택”과 “업무 비용에 맞는 임곗값 선택”을 서로 다른 단계로 구분한다.
| 판단 | 필요한 정보 | 자주 하는 오해 |
|---|---|---|
| 모형의 전반적 순위 구분력 | ROC·AUC, PR-AUC | AUC가 높으면 임곗값도 자동 결정됨 |
| 실제 운영점 선택 | 임곗값별 혼동행렬, FP·FN 비용 | 정확도 최대 지점이 항상 최적임 |
| 불균형 양성 탐지 | 정밀도·재현율·PR 곡선 | ROC-AUC만 보면 충분함 |
개념 확인 문제
문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.
01같은 점수와 표본에서 양성 판정 임곗값을 낮출 때의 변화를 올바르게 제시하시오.
양성 예측 수가 늘며 TPR과 FPR은 증가하거나 유지된다.
임곗값을 낮추면 기존 양성 예측을 유지한 채 더 많은 사례가 양성 예측에 포함되므로 TP와 FP는 감소하지 않고 TPR과 FPR은 증가하거나 유지된다.
02ROC-AUC에 관해 올바르게 설명하시오.
양성 점수가 음성 점수보다 높을 순위 가능성을 요약하며 확률 보정과는 다르다.
경험적 AUC는 임의의 양성 점수가 임의의 음성 점수보다 높을 가능성을 요약하며 점수 순위에 관한 지표다.
03하루 100만 건 중 양성 비율이 0.1%, TPR=0.80, FPR=0.001일 때 예상 TP, FP, 경보 수의 값을 각각 계산하시오.
800, 999, 1,799
실제 양성은 1,000,000×0.001=1,000건이므로 TP는 1,000×0.80=800건이다. 실제 음성은 999,000건이므로 FP는 999,000×0.001=999건이고 경보 수는 800+999=1,799건이다.
04운영 임곗값을 선택하는 절차로 타당한 내용을 서술하시오.
검증 데이터에서 성능·비용·용량 제약을 비교해 고정하고 독립 테스트에서 한 번 평가한다.
임곗값은 검증 데이터에서 최소 성능, 오류 비용과 처리 용량을 비교해 선택하고 고정한 뒤 독립 테스트에서 한 번 평가해야 한다.