SW 전공

SW 전공 이론 학습

이론 목록으로 돌아가기

회귀와 모델 평가 지표

상관·선형회귀·로지스틱회귀의 기본과 혼동행렬·분류·회귀 평가 지표를 계산하고 해석한다.

예상 읽기 7

1. 상관관계

상관계수는 두 수치 변수가 함께 변하는 선형 관계의 방향과 강도를 나타낸다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
-1 ≤ r ≤ 1
r > 0 : 함께 증가하는 경향
r < 0 : 한쪽이 증가할 때 다른 쪽 감소 경향
r ≈ 0 : 선형 관계가 약함
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
양의 상관        상관 약함        음의 상관
•        •       •  •    •       •
  •    •         •    •        •
    •            • •      •  •

상관은 인과를 증명하지 않는다. 제3변수, 역인과, 우연, 선택편향을 검토해야 한다.

2. 단순선형회귀

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
y = β0 + β1x + ε
  • β0: 절편
  • β1: x가 1 증가할 때 y의 평균 변화량
  • ε: 모델이 설명하지 못한 오차

예:

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
처리시간 = 1.2 + 0.08 × 항목수

항목수가 1개 늘 때 평균 처리시간이 0.08초 늘어난다고 해석한다. 관측 범위 밖의 과도한 외삽은 위험하다.

3. 잔차와 최소제곱

잔차:

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
잔차 = 실제값 - 예측값

최소제곱법은 잔차 제곱합을 작게 하는 계수를 찾는다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
실제점 •
      │ 잔차
      ▼
회귀선 ─────────

잔차 그래프에서 비선형 패턴, 분산 변화, 극단값이 보이면 선형회귀 가정이 맞지 않을 수 있다.

4. 결정계수 R²

R²는 모델이 종속변수 변동을 어느 정도 설명하는지 나타내는 지표이다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
R² = 1 - SSE / SST

일반적으로 높을수록 설명력이 크지만 다음을 주의한다.

  • 높은 R²가 인과관계를 뜻하지 않음
  • 예측 목적에서는 평가 데이터 성능이 더 중요
  • 변수를 추가하면 R²가 줄지 않는 경향
  • 나쁜 데이터나 누수로 높아질 수 있음

조정 R²는 변수 수에 대한 패널티를 포함한다.

5. 로지스틱회귀

이진 분류에서 입력의 선형결합을 0~1 확률로 변환한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
z = β0 + β1x1 + ... + βkxk
p = 1 / (1 + e^(-z))
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
z가 작음 ─────────── z가 큼
p 0 ──── S자 곡선 ──── 1

임계값을 적용해 클래스를 결정한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
p >= 0.5 → 양성
p < 0.5  → 음성

임계값을 바꾸면 정밀도와 재현율의 균형이 달라진다.

6. 혼동행렬

실제\예측양성음성
양성TPFN
음성FPTN
  • TP: 실제 양성을 양성으로 예측
  • FN: 실제 양성을 놓침
  • FP: 실제 음성을 잘못 경보
  • TN: 실제 음성을 정상으로 예측
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
사기탐지
TP: 사기를 탐지
FN: 사기를 놓침
FP: 정상 거래를 사기로 차단
TN: 정상 거래를 정상 처리

7. 분류 평가 지표

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
Accuracy  = (TP + TN) / 전체
Precision = TP / (TP + FP)
Recall    = TP / (TP + FN)
Specificity = TN / (TN + FP)
F1 = 2 × Precision × Recall / (Precision + Recall)

예:

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
TP=40, FP=10, FN=20, TN=930

Accuracy = 970/1000 = 97%
Precision = 40/50 = 80%
Recall = 40/60 ≈ 66.7%

정확도가 높아도 희귀 이상을 많이 놓칠 수 있다.

8. 지표 선택

상황우선 고려
암 진단·침해탐지처럼 놓침 비용 큼Recall
정상 고객 차단 비용 큼Precision·Specificity
클래스가 불균형하고 정밀도·재현율 균형F1
전체 클래스가 균형이고 오류비용 유사Accuracy
임계값 전반의 순위 성능ROC-AUC, PR-AUC

PR-AUC는 양성 클래스가 매우 희귀할 때 더 직접적인 정보를 줄 수 있다.

9. ROC와 AUC

ROC 곡선은 임계값을 바꾸며 TPR과 FPR을 나타낸다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
TPR = Recall
FPR = FP / (FP + TN)

AUC는 임의의 양성 사례가 임의의 음성 사례보다 높은 점수를 받을 가능성과 연결해 해석할 수 있다. AUC가 높아도 특정 운영 임계값에서 원하는 정밀도·재현율을 만족하는지 확인해야 한다.

10. 회귀 평가 지표

실제값 y, 예측값 ŷ, 오차 e=y-ŷ.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
MAE  = 평균(|e|)
MSE  = 평균(e²)
RMSE = √MSE
  • MAE: 원래 단위, 이상치 영향 상대적으로 작음
  • MSE: 큰 오차에 더 큰 패널티
  • RMSE: 원래 단위, 큰 오차 강조
  • MAPE: 비율 해석이 쉽지만 실제값 0·작은 값에서 문제
  • R²: 설명된 변동 비율 관점

예:

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
실제: 10, 20, 30
예측: 12, 18, 33
오차: -2, 2, -3
MAE = (2+2+3)/3 ≈ 2.33
MSE = (4+4+9)/3 ≈ 5.67
RMSE ≈ 2.38

11. 평가 데이터와 기준모델

모델 성능은 학습에 사용하지 않은 데이터에서 평가한다.

기준모델 예:

  • 항상 평균 예측
  • 가장 많은 클래스 예측
  • 단순 규칙
  • 기존 운영 모델

복잡한 모델이 기준모델보다 실제 업무 지표에서 의미 있게 나은지 확인한다.

12. 임계값과 비용

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
낮은 임계값
  → 양성 예측 증가
  → Recall 상승 가능
  → FP 증가 가능

높은 임계값
  → 양성 예측 감소
  → Precision 상승 가능
  → FN 증가 가능

최적 임계값은 통계 지표뿐 아니라 업무 비용, 처리 가능 인력, 법·안전 요구로 결정한다.

13. 회귀계수·잔차·진단

단순선형회귀 ŷ=b0+b1x에서 기울기는 b1=Cov(x,y)/Var(x)로 표현할 수 있다. 예측오차인 잔차는 e=y-ŷ이다. 잔차 대 적합값 그림에서 부채꼴 모양이 나타나면 오차분산이 일정하지 않은 이분산성을 의심한다.

설명변수 사이의 강한 선형관계는 계수의 분산을 키워 해석을 불안정하게 할 수 있다. VIF가 크면 다중공선성을 의심하되 절대 기준을 기계적으로 적용하지 않고 업무 맥락과 계수 안정성을 함께 본다.

14. 혼동행렬에서 파생되는 지표

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
정밀도 = TP/(TP+FP)
재현율 = TP/(TP+FN)
특이도 = TN/(TN+FP)
F1 = 2×정밀도×재현율/(정밀도+재현율)
균형정확도 = (재현율+특이도)/2

TP=40, FP=10, FN=20, TN=130이면 정밀도 0.8, 재현율 약 0.667, 특이도 약 0.929이다. 불균형 데이터에서 다수 클래스를 모두 예측한 높은 정확도는 쓸모가 없을 수 있다.

15. 평균 방식과 임계값

  • Macro: 클래스별 지표를 같은 비중으로 평균
  • Micro: 모든 클래스의 TP·FP·FN을 합쳐 계산
  • Weighted: 클래스별 표본 수로 가중 평균

오탐 비용과 미탐 비용이 다르면 기본 임계값 0.5가 최적이라는 보장이 없다. 예측확률이 잘 보정되어 있고 양성 예측의 기대비용을 비교한다면, 행동 비용을 기준으로 임계값을 조정한다.

16. 확률 예측과 순위 평가

ROC-AUC는 임계값 전반의 TPR과 FPR 관계를 요약한다. 양성이 매우 희귀할 때는 Precision-Recall 곡선이 양성 탐지 성능을 더 직접적으로 보여줄 수 있다. AUC가 높아도 확률이 잘 보정된 것은 아니다.

  • Log loss: 틀린 고신뢰 예측을 크게 벌점
  • Brier score: 예측확률과 0/1 결과의 제곱오차 평균
  • Calibration: 예측확률 0.8인 집단에서 실제 양성률도 약 0.8인지 확인

17. 회귀 지표의 선택

  • MAE: 오차 절댓값 평균, RMSE보다 극단값 영향이 작음
  • RMSE: 큰 오차를 더 크게 벌점
  • MAPE: 실제값이 0 또는 매우 작을 때 불안정
  • R²: 기준 평균모델 대비 설명된 변동 비율이며, 외부 평가에서 음수가 될 수도 있음
  • 조정 R²: 불필요한 변수 추가에 벌점

확인 문제

  1. TP=40, FP=10일 때 정밀도는?
  2. TP=40, FN=20일 때 재현율은?
  3. 큰 오차를 더 크게 벌점하는 회귀 지표는?
  4. AUC가 높으면 확률도 반드시 잘 보정되는가?
  5. 실제값이 0일 때 불안정한 지표는?