현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

로지스틱 회귀와 오즈 해석

로지스틱 회귀의 확률·오즈 해석과 성능 진단 방법을 익힌다.

예상 읽기 12

핵심 요약

로지스틱 회귀는 이름에 ‘회귀’가 있지만 이진 목표 Y∈{0,1}양성 클래스 확률을 추정하는 지도학습 분류모형이다. 선형예측값을 시그모이드 함수로 확률에 매핑하고, 업무 목적에 맞는 임곗값을 적용해 클래스를 정한다. 0.5는 기본값일 수는 있어도 고정 법칙은 아니다.

계수 βj는 확률의 직접 변화량이 아니라 다른 변수를 고정했을 때 로그 오즈의 변화량이다. 따라서 exp(βj)는 조건부 오즈비다. 오즈비 2를 “확률이 2배” 또는 “200%p 증가”라고 해석하면 틀린다. 계수의 연관성을 인과효과로 바꾸어 읽으려면 시간적 선후, 교란 통제와 적절한 연구 설계가 별도로 필요하다.

학습 목표

  • 확률·오즈·로짓·시그모이드의 관계와 정의역을 계산한다.
  • 수치형·범주형·상호작용 계수와 오즈비를 조건에 맞게 해석한다.
  • 최대우도, 로그손실과 규제의 역할을 구분한다.
  • 임곗값 지표, 순위 판별 지표와 확률 품질 지표를 목적에 맞게 선택한다.
  • 선형 로짓·완전분리·불균형·다중공선성·보정 문제와 누수를 진단한다.

1. 이진 로지스틱 모형

p(x)=P(Y=1|X=x)라 하면 선형예측값 η와 확률의 관계는 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
η = β0 + β1x1 + ... + βkxk
p = 1 / (1 + exp(-η)),          0 < p < 1
logit(p) = ln[p/(1-p)] = η

시그모이드는 모든 실수 η(0,1)로 보낸다. η=0이면 p=0.5이고, η가 커질수록 p는 1에 가까워지지만 유한한 η에서 1이 되지는 않는다.

아래 그래프의 가로축은 η, 세로축은 p다. 가운데에서는 기울기가 크지만 양끝에서는 같은 η 변화가 만드는 확률 변화가 작아진다.

MERMAID코드 영역 안에서 좌우로 이동할 수 있습니다.
xychart-beta
    title "시그모이드: 선형예측값과 양성 확률"
    x-axis "η" [-4, -3, -2, -1, 0, 1, 2, 3, 4]
    y-axis "p" 0 --> 1
    line [0.018, 0.047, 0.119, 0.269, 0.500, 0.731, 0.881, 0.953, 0.982]

입력은 수치형 변수 또는 적절히 인코딩한 범주형 변수다. 다중 로지스틱 회귀는 여러 설명변수를 동시에 사용한다. 목표가 세 범주 이상이면 기준범주를 두는 다항 로지스틱 회귀 등으로 확장할 수 있으나, 이 단원의 식은 이진 모형을 기준으로 한다.

2. 확률·오즈·로짓

확률 p의 오즈는 사건이 일어날 확률과 일어나지 않을 확률의 비다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
odds = p/(1-p)
p = odds/(1+odds)
logit(p) = ln(odds)
확률 p오즈 p/(1-p)로짓 ln(odds)해석
0.200.25약 -1.386양성 1에 대해 음성 4
0.5010양성과 음성의 가능성이 같음
0.804약 1.386양성 4에 대해 음성 1

p=0이면 오즈는 0이지만 로짓은 유한하게 정의되지 않고 -∞로 향한다. p→1이면 오즈와 로짓은 로 향한다. 이 경계 때문에 로그손실 구현에서는 보통 예측확률을 아주 작은 양수와 1-아주 작은 양수 사이로 수치적으로 제한한다.

3. 계수와 오즈비 해석

다른 변수를 고정하고 xjΔ만큼 변하면 오즈의 배수는 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
OR(Δ) = exp(βj × Δ)
한 단위 증가: OR = exp(βj)
항의 종류exp(β)의 올바른 해석주의점
연속형 xx가 1단위 증가할 때의 조건부 오즈 배수단위가 1원인지 1천 원인지 확인
더미변수 D기준범주 대비 D=1 범주의 조건부 오즈 배수기준범주를 반드시 명시
상호작용 x×zz에 따라 x의 로그 오즈 기울기가 얼마나 달라지는지주효과만 따로 읽으면 안 됨
비선형항 포함효과가 x의 현재 값에 따라 달라짐exp(βx)만으로 전체 효과를 요약할 수 없음

오즈비 2가 확률 2배가 아닌 이유

기저 확률이 0.20이면 기저 오즈는 0.20/0.80=0.25다. β=ln(2)인 변수가 한 단위 증가하면 오즈는 두 배인 0.50이지만 새 확률은 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
new odds = 0.25 × 2 = 0.50
new p = 0.50/(1+0.50) = 1/3 ≈ 0.333

확률은 0.20→0.333으로 약 0.133p 증가한다. 0.40이 아니다. 같은 오즈비라도 기저 확률이 다르면 확률의 절대 변화가 달라진다. 또한 오즈비는 일반적으로 위험비와 같지 않고, 조건부 오즈비는 변수 조정 전 주변 오즈비와도 달라질 수 있으므로 비교 대상을 명시한다.

4. 학습 원리: 최대우도·로그손실·규제

관측치가 조건부로 독립인 베르누이 자료라면 계수는 우도를 최대화하도록 추정한다. 이는 음의 로그우도인 이진 로그손실을 최소화하는 것과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
L(β) = -Σ[yi ln(pi) + (1-yi) ln(1-pi)]

최대우도는 추정 원리, 경사하강법·뉴턴법·준뉴턴법 같은 방법은 그 목적함수를 푸는 최적화 알고리즘이다. 둘을 같은 개념으로 보지 않는다. 확신한 오답은 로그손실이 매우 커진다.

과대적합과 계수 불안정을 줄이기 위해 벌점을 추가할 수 있다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
ridge: L(β) + λΣβj²
lasso: L(β) + λΣ|βj|

일반적으로 절편은 벌점에서 제외한다. λ와 규제 종류는 훈련 데이터 안의 교차검증으로 선택하고 테스트 데이터로 조정하지 않는다. 규제는 변수 단위의 영향을 받으므로 수치형 변수의 표준화도 각 훈련 폴드 안에서 학습해야 한다. 라쏘는 일부 계수를 정확히 0으로 만들 수 있고, 리지는 상관된 변수의 계수를 함께 축소하는 경향이 있다.

5. 주요 가정과 진단

문제관찰·진단해석 위험과 대응
선형 로짓 위반연속형 변수와 로짓의 관계, 잔차·부분효과 확인스플라인·다항항·변환·상호작용을 검증
종속 관측반복측정, 집락, 시계열 구조 확인군집 표준오차·혼합모형·시간 구조 고려
완전·준완전분리매우 큰 계수·표준오차, 수렴 경고, 교차표 확인규제·Firth형 편향 보정·변수 재정의 고려
다중공선성계수·표준오차 불안정, 상관과 VIF 보조 확인변수 결합·제거의 근거 검토, 규제 고려
희귀 범주·영향점레버리지·잔차·영향도와 범주 빈도 확인데이터 오류부터 점검하고 자동 삭제 금지

선형성은 x와 확률 자체의 직선 관계가 아니라 연속형 설명변수와 로그 오즈의 조건부 관계에 관한 가정이다. 비선형항이나 상호작용을 넣어도 계수에 대해 선형인 로짓 구조는 유지할 수 있다.

완전분리에서는 어떤 변수 조합이 두 클래스를 완전히 나누어 유한한 최대우도 추정치가 존재하지 않을 수 있다. 준완전분리도 계수와 표준오차를 크게 만들 수 있다. 단순히 반복 횟수만 늘려 수렴 경고를 숨기지 말고 자료 구조와 교차표를 확인한다.

다중공선성은 예측을 반드시 나쁘게 만드는 것이 아니라 개별 계수와 오즈비의 불확실성을 키울 수 있다. 유의하지 않은 계수를 곧바로 효과 없음으로 단정하지 않는다.

6. 불균형 자료와 누수 방지

양성이 3%인 자료에서 모두 음성으로 예측하면 정확도는 97%지만 양성을 하나도 찾지 못한다. 정확도만으로 평가하지 말고 업무 목적에 따라 정밀도·재현율·특이도·PR-AUC 등을 함께 본다.

  • 오버샘플링·언더샘플링·SMOTE·클래스 가중치는 훈련 폴드 안에서만 적용한다.
  • 검증·테스트의 원래 클래스 비율은 유지해 현실의 성능과 보정을 평가한다.
  • 재표본추출이나 클래스 가중치는 학습된 확률의 보정을 바꿀 수 있다. 확률을 실제 위험률로 쓸 때는 원래 분포의 독립 검증 자료에서 보정곡선과 점수를 다시 확인한다.
  • 결측 대체·인코딩·스케일링·특성 선택도 훈련 폴드 안에서 학습해 누수를 막는다.

7. 성능 평가: 세 질문을 분리한다

혼동행렬의 양성 기준을 먼저 고정한다. TP는 실제 양성을 양성으로, TN은 실제 음성을 음성으로, FP는 실제 음성을 양성으로, FN은 실제 양성을 음성으로 예측한 수다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
precision = TP/(TP+FP)
recall(sensitivity) = TP/(TP+FN)
specificity = TN/(TN+FP)
F1 = 2×precision×recall/(precision+recall)
Brier = (1/n)Σ(pi-yi)²
평가 질문대표 지표핵심 해석·경계
정한 임곗값에서 분류가 좋은가?혼동행렬, 정밀도, 재현율, 특이도, F1분모가 0이면 해당 비율이 정의되지 않을 수 있음
양성을 음성보다 위에 순위화하는가?ROC-AUC, PR-AUC임곗값 하나와 무관한 판별력; 보정을 뜻하지 않음
예측확률이 실제 발생률과 맞는가?로그손실, Brier 점수, 보정곡선낮을수록 좋음; 표본의 유병률과 비교 기준을 함께 봄

ROC-AUC는 임의의 양성 사례가 임의의 음성 사례보다 높은 점수를 받을 확률로 해석할 수 있다. PR-AUC는 희귀 양성의 검색 성능에 유용하지만 무작위 기준선이 양성 비율에 의존하므로 서로 다른 자료의 값은 유병률을 함께 본다. 높은 AUC는 좋은 확률 보정을 보장하지 않는다.

이진 Brier 점수는 완전한 예측에서 0이고 최악의 경우 1까지 가능하다. 로그손실은 확신한 오답을 더 강하게 벌한다. 지표는 훈련에 쓰지 않은 검증·테스트 자료에서 계산한다.

8. 분류 임곗값 선택

예측확률 p≥t이면 양성으로 분류한다고 하자. t를 낮추면 보통 재현율이 높아지고 거짓양성도 늘어난다. 임곗값은 다음을 반영해 검증 데이터에서 정한다.

  • 거짓양성·거짓음성의 업무 비용
  • 조사·심사·치료 등 후속 처리 용량
  • 최소 재현율 또는 최소 정밀도 같은 운영 제약
  • 배포 환경의 클래스 비율과 시간 변화

임곗값을 테스트 결과에 맞춰 고르면 테스트가 더 이상 독립 평가 자료가 아니다. 모형·규제·임곗값 선택을 끝낸 뒤 테스트는 마지막 한 번의 일반화 평가에 사용한다.

9. 사례 적용

상황: 소득, 부채비율과 거래기간으로 대출 연체 확률을 추정한다. 실제 연체율은 3%이며 확률을 심사 등급과 충당금에 사용한다.

판단 과정:

  1. 목표 1=연체와 관측 시점을 고정하고 미래 정보를 제거한다.
  2. 시간 순서로 훈련·검증·테스트를 나눈다.
  3. 전처리, 규제와 클래스 가중치를 훈련 폴드 안에서 교차검증한다.
  4. 부채비율의 선형 로짓, 희귀 범주, 분리와 계수 안정성을 확인한다.
  5. ROC-AUC·PR-AUC로 순위 판별력을, Brier 점수·보정곡선과 등급별 관측 연체율로 확률 품질을 평가한다.
  6. 연체 손실, 정상 고객 거절 비용과 심사 용량을 반영해 검증 자료에서 임곗값을 정한다.
  7. 고정된 전체 절차를 시간상 미래인 테스트 자료에서 최종 평가한다.

결론: 확률 추정, 순위 판별과 클래스 결정을 분리하고 오즈비·보정·오류 비용을 함께 보고한다.

오답 함정: “정확도 97%이므로 우수하다”, “오즈비 2이므로 연체 확률도 2배다”, “AUC가 높으므로 예측확률도 정확하다”, “임곗값은 항상 0.5다”는 모두 성립하지 않는다.

선형예측값 z가 로지스틱 시그모이드 함수를 거쳐 확률로 변환되고 z=0에서 확률 0.5가 되는 그래프
선형예측값 z가 로지스틱 시그모이드 함수를 거쳐 확률로 변환되고 z=0에서 확률 0.5가 되는 그래프
logit(p)=log(p) ÷ (1-p)=β_0+β x, p=\frac11+e^-z

계수 $\beta$는 $x$ 한 단위 증가에 대한 로그오즈 변화량이고 $e^\beta$가 오즈비다. 예를 들어 $\beta=0.8$이면 오즈는 약 $e^{0.8}=2.23$배가 되지만 확률이 0.8만큼 증가한다는 뜻은 아니다.

여덟 관측치의 예측확률을 0.5 임곗값 위아래로 나누어 양성과 음성 판정을 표시한 점 그래프
여덟 관측치의 예측확률을 0.5 임곗값 위아래로 나누어 양성과 음성 판정을 표시한 점 그래프
요소학습 결과운영 선택
예측확률모형이 출력보정 여부 점검
임곗값자동 고정 아님오류 비용·처리량으로 선택
분류 라벨확률과 임곗값 비교임곗값 변경 시 달라짐

시험에서는 오즈비 해석과 확률 변화량을 구분하고, 임곗값이 분류 결과를 결정한다는 점을 확인한다.

시험 판단 포인트

  • 이진 로지스틱 회귀는 P(Y=1|X)를 추정하며 로짓이 설명변수의 선형결합이다.
  • exp(βj)는 다른 변수를 고정한 한 단위 변화의 조건부 오즈비이며 확률비가 아니다.
  • 최대우도는 추정 원리이고 경사하강법 등은 최적화 방법이다.
  • 완전분리에서는 최대우도 계수가 발산할 수 있고 반복 횟수 증가만으로 해결되지 않는다.
  • 불균형 처리와 모든 전처리는 훈련 폴드 안에서 수행한다.
  • 임곗값 지표, AUC 계열과 확률 보정 지표는 서로 다른 질문에 답한다.
  • 규제 강도와 임곗값은 검증으로 선택하며 테스트로 조정하지 않는다.
  • 통계적 연관성과 인과효과를 구분한다.

자주 틀리는 부분

  • 오즈 4를 확률 400%로 읽지 않는다. 오즈 4의 확률은 4/(1+4)=0.8이다.
  • 오즈비 2를 확률 2배 또는 200%p 증가로 해석하지 않는다.
  • 상호작용이 있는 모형에서 주효과 계수만 독립적으로 해석하지 않는다.
  • 정확도나 ROC-AUC 하나만으로 희귀 양성 검색과 확률 보정을 모두 판단하지 않는다.
  • 클래스 가중치나 재표본추출 뒤의 출력확률을 보정 확인 없이 실제 위험률로 쓰지 않는다.
  • 작은 p-value를 곧바로 인과효과의 증거로 보지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01기저 확률이 0.20이고 어떤 변수의 한 단위 증가에 대한 오즈비가 2일 때 새 확률은?
정답 및 해설

약 0.333

02완전분리가 발생한 이진 로지스틱 회귀에 관해 올바르게 설명하시오.
정답 및 해설

유한한 최대우도 계수가 존재하지 않을 수 있어 규제나 편향 보정을 검토한다.

규제·Firth형 편향 보정·변수 재정의를 검토한다.

03양성 비율이 낮고 예측확률을 실제 위험률로 사용할 때 적절한 평가 지표 조합을 서술하시오.
정답 및 해설

PR-AUC와 함께 Brier 점수·보정곡선·등급별 관측률을 확인한다.

04분류 임곗값 선택에 관해 올바르게 설명하시오.
정답 및 해설

오류 비용·처리 용량·운영 제약을 반영해 검증 자료에서 정한다.