회귀와 모델 평가 지표
상관·선형회귀·로지스틱회귀의 기본과 혼동행렬·분류·회귀 평가 지표를 계산하고 해석한다.
1. 상관관계
상관계수는 두 수치 변수가 함께 변하는 선형 관계의 방향과 강도를 나타낸다.
-1 ≤ r ≤ 1
r > 0 : 함께 증가하는 경향
r < 0 : 한쪽이 증가할 때 다른 쪽 감소 경향
r ≈ 0 : 선형 관계가 약함
양의 상관 상관 약함 음의 상관
• • • • • •
• • • • •
• • • • •
상관은 인과를 증명하지 않는다. 제3변수, 역인과, 우연, 선택편향을 검토해야 한다.
2. 단순선형회귀
y = β0 + β1x + ε
- β0: 절편
- β1: x가 1 증가할 때 y의 평균 변화량
- ε: 모델이 설명하지 못한 오차
예:
처리시간 = 1.2 + 0.08 × 항목수
항목수가 1개 늘 때 평균 처리시간이 0.08초 늘어난다고 해석한다. 관측 범위 밖의 과도한 외삽은 위험하다.
3. 잔차와 최소제곱
잔차:
잔차 = 실제값 - 예측값
최소제곱법은 잔차 제곱합을 작게 하는 계수를 찾는다.
실제점 •
│ 잔차
▼
회귀선 ─────────
잔차 그래프에서 비선형 패턴, 분산 변화, 극단값이 보이면 선형회귀 가정이 맞지 않을 수 있다.
4. 결정계수 R²
R²는 모델이 종속변수 변동을 어느 정도 설명하는지 나타내는 지표이다.
R² = 1 - SSE / SST
일반적으로 높을수록 설명력이 크지만 다음을 주의한다.
- 높은 R²가 인과관계를 뜻하지 않음
- 예측 목적에서는 평가 데이터 성능이 더 중요
- 변수를 추가하면 R²가 줄지 않는 경향
- 나쁜 데이터나 누수로 높아질 수 있음
조정 R²는 변수 수에 대한 패널티를 포함한다.
5. 로지스틱회귀
이진 분류에서 입력의 선형결합을 0~1 확률로 변환한다.
z = β0 + β1x1 + ... + βkxk
p = 1 / (1 + e^(-z))
z가 작음 ─────────── z가 큼
p 0 ──── S자 곡선 ──── 1
임계값을 적용해 클래스를 결정한다.
p >= 0.5 → 양성
p < 0.5 → 음성
임계값을 바꾸면 정밀도와 재현율의 균형이 달라진다.
6. 혼동행렬
| 실제\예측 | 양성 | 음성 |
|---|---|---|
| 양성 | TP | FN |
| 음성 | FP | TN |
- TP: 실제 양성을 양성으로 예측
- FN: 실제 양성을 놓침
- FP: 실제 음성을 잘못 경보
- TN: 실제 음성을 정상으로 예측
사기탐지
TP: 사기를 탐지
FN: 사기를 놓침
FP: 정상 거래를 사기로 차단
TN: 정상 거래를 정상 처리
7. 분류 평가 지표
Accuracy = (TP + TN) / 전체
Precision = TP / (TP + FP)
Recall = TP / (TP + FN)
Specificity = TN / (TN + FP)
F1 = 2 × Precision × Recall / (Precision + Recall)
예:
TP=40, FP=10, FN=20, TN=930
Accuracy = 970/1000 = 97%
Precision = 40/50 = 80%
Recall = 40/60 ≈ 66.7%
정확도가 높아도 희귀 이상을 많이 놓칠 수 있다.
8. 지표 선택
| 상황 | 우선 고려 |
|---|---|
| 암 진단·침해탐지처럼 놓침 비용 큼 | Recall |
| 정상 고객 차단 비용 큼 | Precision·Specificity |
| 클래스가 불균형하고 정밀도·재현율 균형 | F1 |
| 전체 클래스가 균형이고 오류비용 유사 | Accuracy |
| 임계값 전반의 순위 성능 | ROC-AUC, PR-AUC |
PR-AUC는 양성 클래스가 매우 희귀할 때 더 직접적인 정보를 줄 수 있다.
9. ROC와 AUC
ROC 곡선은 임계값을 바꾸며 TPR과 FPR을 나타낸다.
TPR = Recall
FPR = FP / (FP + TN)
AUC는 임의의 양성 사례가 임의의 음성 사례보다 높은 점수를 받을 가능성과 연결해 해석할 수 있다. AUC가 높아도 특정 운영 임계값에서 원하는 정밀도·재현율을 만족하는지 확인해야 한다.
10. 회귀 평가 지표
실제값 y, 예측값 ŷ, 오차 e=y-ŷ.
MAE = 평균(|e|)
MSE = 평균(e²)
RMSE = √MSE
- MAE: 원래 단위, 이상치 영향 상대적으로 작음
- MSE: 큰 오차에 더 큰 패널티
- RMSE: 원래 단위, 큰 오차 강조
- MAPE: 비율 해석이 쉽지만 실제값 0·작은 값에서 문제
- R²: 설명된 변동 비율 관점
예:
실제: 10, 20, 30
예측: 12, 18, 33
오차: -2, 2, -3
MAE = (2+2+3)/3 ≈ 2.33
MSE = (4+4+9)/3 ≈ 5.67
RMSE ≈ 2.38
11. 평가 데이터와 기준모델
모델 성능은 학습에 사용하지 않은 데이터에서 평가한다.
기준모델 예:
- 항상 평균 예측
- 가장 많은 클래스 예측
- 단순 규칙
- 기존 운영 모델
복잡한 모델이 기준모델보다 실제 업무 지표에서 의미 있게 나은지 확인한다.
12. 임계값과 비용
낮은 임계값
→ 양성 예측 증가
→ Recall 상승 가능
→ FP 증가 가능
높은 임계값
→ 양성 예측 감소
→ Precision 상승 가능
→ FN 증가 가능
최적 임계값은 통계 지표뿐 아니라 업무 비용, 처리 가능 인력, 법·안전 요구로 결정한다.
13. 회귀계수·잔차·진단
단순선형회귀 ŷ=b0+b1x에서 기울기는 b1=Cov(x,y)/Var(x)로 표현할 수 있다. 예측오차인 잔차는 e=y-ŷ이다. 잔차 대 적합값 그림에서 부채꼴 모양이 나타나면 오차분산이 일정하지 않은 이분산성을 의심한다.
설명변수 사이의 강한 선형관계는 계수의 분산을 키워 해석을 불안정하게 할 수 있다. VIF가 크면 다중공선성을 의심하되 절대 기준을 기계적으로 적용하지 않고 업무 맥락과 계수 안정성을 함께 본다.
14. 혼동행렬에서 파생되는 지표
정밀도 = TP/(TP+FP)
재현율 = TP/(TP+FN)
특이도 = TN/(TN+FP)
F1 = 2×정밀도×재현율/(정밀도+재현율)
균형정확도 = (재현율+특이도)/2
TP=40, FP=10, FN=20, TN=130이면 정밀도 0.8, 재현율 약 0.667, 특이도 약 0.929이다. 불균형 데이터에서 다수 클래스를 모두 예측한 높은 정확도는 쓸모가 없을 수 있다.
15. 평균 방식과 임계값
- Macro: 클래스별 지표를 같은 비중으로 평균
- Micro: 모든 클래스의 TP·FP·FN을 합쳐 계산
- Weighted: 클래스별 표본 수로 가중 평균
오탐 비용과 미탐 비용이 다르면 기본 임계값 0.5가 최적이라는 보장이 없다. 예측확률이 잘 보정되어 있고 양성 예측의 기대비용을 비교한다면, 행동 비용을 기준으로 임계값을 조정한다.
16. 확률 예측과 순위 평가
ROC-AUC는 임계값 전반의 TPR과 FPR 관계를 요약한다. 양성이 매우 희귀할 때는 Precision-Recall 곡선이 양성 탐지 성능을 더 직접적으로 보여줄 수 있다. AUC가 높아도 확률이 잘 보정된 것은 아니다.
- Log loss: 틀린 고신뢰 예측을 크게 벌점
- Brier score: 예측확률과 0/1 결과의 제곱오차 평균
- Calibration: 예측확률 0.8인 집단에서 실제 양성률도 약 0.8인지 확인
17. 회귀 지표의 선택
- MAE: 오차 절댓값 평균, RMSE보다 극단값 영향이 작음
- RMSE: 큰 오차를 더 크게 벌점
- MAPE: 실제값이 0 또는 매우 작을 때 불안정
- R²: 기준 평균모델 대비 설명된 변동 비율이며, 외부 평가에서 음수가 될 수도 있음
- 조정 R²: 불필요한 변수 추가에 벌점
확인 문제
- TP=40, FP=10일 때 정밀도는?
- TP=40, FN=20일 때 재현율은?
- 큰 오차를 더 크게 벌점하는 회귀 지표는?
- AUC가 높으면 확률도 반드시 잘 보정되는가?
- 실제값이 0일 때 불안정한 지표는?