현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

선형회귀의 원리와 진단

선형회귀의 추정 원리와 계수 해석·잔차 진단 방법을 익힌다.

예상 읽기 15

핵심 요약

선형회귀는 연속형 목표변수의 조건부 평균을 설명변수의 선형결합으로 나타내는 지도학습 모형이다. 여기서 선형은 원자료의 모양이 반드시 직선이라는 뜻보다 계수에 대해 선형이라는 뜻이다. 따라서 (x^2), 상호작용항처럼 변환한 변수를 넣어도 계수의 선형결합이면 선형회귀로 적합할 수 있다.

보통최소제곱법은 잔차제곱합을 최소화한다. 계수 해석과 통계적 추론에서는 조건부 평균 구조, 외생성, 오차 의존성·등분산성·정규성을 구분해 확인한다. 예측 목적에서는 독립 검증 성능과 외삽 위험이 더 직접적이다. 높은 (R^2)나 유의한 계수만으로 일반화 성능 또는 인과효과가 증명되지는 않는다.

학습 목표

  • 선형회귀의 입력·출력, 조건부 평균과 계수에 대한 선형성을 설명한다.
  • 단순회귀 계수, 예측값, 잔차와 잔차제곱합을 계산한다.
  • 예측 목적과 계수 추론 목적에 필요한 가정을 구분한다.
  • (R^2), 조정 (R^2), MAE·RMSE와 예측구간을 해석한다.
  • 잔차, 영향점, 다중공선성을 진단하고 리지·라쏘를 선택한다.

0. 먼저 구분할 것: 예측과 설명·추론

  • 예측 목적: 새 데이터의 연속형 값을 정확히 예측하는지가 핵심이다. 훈련 밖의 MAE·RMSE와 시간·그룹 구조를 반영한 검증을 우선한다.
  • 설명·추론 목적: 다른 변수를 고정했을 때 계수의 방향·크기와 불확실성을 해석한다. 표본추출, 모형 형태, 외생성, 오차 구조와 표준오차가 중요하다.
  • 인과 목적: 회귀계수가 인과효과가 되려면 시간 순서, 교란 통제, 처치 배정이나 식별 가정 같은 추가 설계가 필요하다. 회귀 적합만으로는 충분하지 않다.

같은 선형회귀라도 목적에 따라 가정 위반의 영향과 대응이 달라진다. 예측이 잘돼도 계수를 인과적으로 해석할 수 없고, 일부 추론 가정이 약해도 검증 예측은 유용할 수 있다.

1. 모형, 예측값과 잔차

관측치 (i=1,\ldots,n), 설명변수 (j=1,\ldots,p)인 다중선형회귀는 다음과 같다.

[ Y_i=\beta_0+\sum_{j=1}^{p}\beta_jx_{ij}+\varepsilon_i,\qquad \hat{Y}i=b_0+\sum{j=1}^{p}b_jx_{ij},\qquad e_i=Y_i-\hat{Y}_i ]

  • (Y_i): 연속형 목표값
  • (x_{ij}): 관측치 (i)의 설명변수 (j)
  • (\beta_j): 모집단 회귀계수, (b_j): 표본으로 추정한 계수
  • (\varepsilon_i): 관측되지 않은 오차, (e_i): 적합 후 계산한 잔차

(\beta_j)는 다른 설명변수를 고정했을 때 (x_j)가 한 단위 증가할 때 (E(Y\mid X))가 변하는 양이다. 단위가 만원이면 면적 계수의 단위는 만원/㎡다. 범주형 변수는 기준 범주와 비교하는 지시변수로 인코딩하며, 기준 범주에 따라 절편과 범주 계수의 표현은 달라진다.

절편은 모든 설명변수가 0이고 기준 범주일 때의 조건부 평균이다. 0㎡ 주택처럼 0이 자료 범위 밖이면 계산에는 필요해도 직접적인 현실 해석은 제한된다. 변수를 평균 중심화하면 절편을 평균적인 설명변수 수준의 예측값으로 바꿔 해석하기 쉬울 수 있다.

2. 최소제곱법

보통최소제곱법(OLS)은 다음 잔차제곱합을 최소화하는 계수 (b)를 찾는다.

[ SSE(b)=\sum_{i=1}^{n}e_i^2 =\sum_{i=1}^{n}\left(Y_i-b_0-\sum_{j=1}^{p}b_jx_{ij}\right)^2,qquad \hat{b}=\operatorname*{arg,min}_{b}SSE(b) ]

제곱은 양·음의 잔차가 상쇄되지 않게 하고 큰 오차에 더 큰 벌점을 준다. 따라서 극단값의 영향도 커질 수 있다.

2.1 단순선형회귀 계수 계산

설명변수가 하나이고 (S_{xx}=\sum_i(x_i-\bar{x})^2>0)이면 다음과 같다.

[ b_1=\frac{\sum_i(x_i-\bar{x})(y_i-\bar{y})}{\sum_i(x_i-\bar{x})^2} =\frac{S_{xy}}{S_{xx}},\qquad b_0=\bar{y}-b_1\bar{x} ]

예제 데이터가 (x=[1,2,3,4,5]), (y=[2,3,5,4,6])이면 (\bar{x}=3), (\bar{y}=4), (S_{xx}=10), (S_{xy}=9)다. 따라서 (b_1=0.9), (b_0=1.3), 적합식은 (\hat{y}=1.3+0.9x)다.

(x)실제 (y)예측 (\hat{y})잔차 (e=y-\hat{y})(e^2)
122.2-0.20.04
233.1-0.10.01
354.01.01.00
444.9-0.90.81
565.80.20.04
합계0.01.90

절편을 포함한 OLS에서는 훈련 잔차의 합이 수치 오차를 제외하면 0이다. 잔차제곱합은 0.04+0.01+1.00+0.81+0.04=1.90이다. (S_{xx}=0), 즉 모든 (x)가 같으면 기울기를 식별할 수 없다.

막대는 실제값, 선은 적합값이다. 두 값의 세로 차이가 잔차이며, 관측치 3과 4에서 차이가 상대적으로 크다.

MERMAID코드 영역 안에서 좌우로 이동할 수 있습니다.
xychart-beta
  title "실제값(막대)과 적합값(선)"
  x-axis "관측치" [1, 2, 3, 4, 5]
  y-axis "y" 0 --> 7
  bar [2, 3, 5, 4, 6]
  line [2.2, 3.1, 4.0, 4.9, 5.8]

2.2 행렬 표현과 존재 조건

설계행렬 (X)가 절편 열을 포함하고 열들이 완전 선형독립이면 다음과 같이 쓸 수 있다.

[ \hat{b}=(X^{\mathsf T}X)^{-1}X^{\mathsf T}y ]

완전 다중공선성이 있으면 (X^{\mathsf T}X)가 가역이 아니어서 계수가 유일하게 정해지지 않는다. 실제 계산은 역행렬을 직접 만들기보다 QR·특잇값 분해 같은 수치적으로 안정적인 방법을 사용한다. 계수를 계산할 수 있다는 것과 계수가 안정적이라는 것은 다르다. 거의 선형종속인 변수들은 역행렬이 존재해도 계수 분산을 크게 만들 수 있다.

3. 가정은 목적에 맞게 구분한다

조건의미위반 시 주된 영향진단·대응 예
조건부 평균 형태(E(Y\mid X))를 지정한 항들의 선형결합으로 표현곡선·상호작용이 잔차에 남고 예측·계수 왜곡잔차-적합값, 변환·다항항·상호작용
외생성(E(\varepsilon\mid X)=0)누락변수·동시성·측정오차로 계수 편향 가능연구설계, 관련 변수·도메인 검토
독립성·의존 구조오차의 상관 구조를 올바르게 다룸보통 표준오차·검정이 부정확하고 검증도 낙관 가능시간·그룹 진단, 군집·시계열 방법
등분산성(Var(\varepsilon\mid X)=\sigma^2)OLS가 비효율적이고 통상 표준오차가 부정확할 수 있음잔차 부채꼴, 변환·가중회귀·강건 표준오차
오차 정규성조건부 오차분포가 정규소표본 t·F 추론과 구간의 정확성에 영향Q-Q 그림, 이상값·꼬리 확인

설명변수 자체가 정규분포여야 한다 또는 목표변수가 반드시 정규분포여야 한다는 가정은 아니다. 오차 정규성은 OLS 점추정값을 계산하기 위한 필수조건이 아니라 고전적 소표본 추론에 주로 쓰인다.

이분산이 있어도 외생성과 평균 모형이 맞으면 OLS 계수가 곧바로 편향되는 것은 아니다. 그러나 통상 표준오차가 잘못될 수 있고 효율이 낮아질 수 있다. 강건 표준오차는 추론의 표준오차를 보완하지만 비선형 평균 구조, 영향점이나 구간별 예측 불확실성까지 자동으로 해결하지 않는다.

4. 계수, 신뢰구간과 예측구간

회귀계수는 자료에 포함된 다른 변수를 고정한 조건부 관계다. 다음에 주의한다.

  • 계수의 부호와 크기는 변수 단위, 기준 범주와 포함한 공변량에 따라 달라진다.
  • 상호작용이 있으면 한 변수의 효과가 다른 변수 수준에 따라 달라져 주효과만 단독 해석하기 어렵다.
  • 다중공선성이 강하면 전체 예측은 안정적이어도 개별 계수의 부호·표준오차가 불안정할 수 있다.
  • 관측자료 회귀계수는 누락 교란, 선택 편향과 역인과 가능성을 배제하지 못한다.

평균반응의 신뢰구간은 특정 (X)에서 (E(Y\mid X))의 불확실성을 나타낸다. 새 개별 관측값의 예측구간은 평균 추정 불확실성에 개별 오차 변동까지 포함하므로 같은 신뢰수준에서 일반적으로 더 넓다. 자료 범위 밖 외삽에서는 두 구간과 점예측 모두 신뢰하기 어렵다.

5. 평가 지표

[ MAE=\frac{1}{n}\sum_{i=1}^{n}|e_i|,\qquad RMSE=\sqrt{\frac{1}{n}\sum_{i=1}^{n}e_i^2},\qquad R^2=1-\frac{SSE}{SST} ]

여기서 (n>0), (SST=\sum_i(y_i-\bar{y})^2)이며 (R^2)는 (SST>0)일 때 정의한다.

  • MAE는 오차 크기에 선형 비례하고 RMSE는 큰 오차를 더 강하게 반영한다.
  • (R^2)는 기준 평균모형에 비해 변동을 얼마나 줄였는지 나타내지만 오류의 실제 단위를 보여주지 않는다.
  • 절편을 포함한 OLS의 훈련 데이터에서는 보통 (0\le R^2\le1)이다.
  • 검증·테스트 데이터에서는 모형이 그 세트의 평균 예측보다 나쁘면 (R^2<0)이 될 수 있다.
  • 모든 목표값이 같아 (SST=0)이면 이 정의의 (R^2)는 계산할 수 없다.

앞의 다섯 관측치 예제에서는 (SST=10), (SSE=1.90)이므로 훈련 (R^2=1-1.90/10=0.81)이다. 절대잔차 합은 2.4이므로 (MAE=0.48), (RMSE=\sqrt{1.90/5}=\sqrt{0.38}\approx0.616)이다. 세 지표는 같은 잔차를 서로 다른 관점에서 요약한다.

설명변수 수를 늘리면 훈련 (R^2)는 감소하지 않으므로 조정 (R^2)는 변수 수를 벌점으로 반영한다.

[ \bar{R}^{2}=1-(1-R^2)\frac{n-1}{n-p-1} ]

여기서 (p)는 절편을 제외한 설명변수 수이고 (n>p+1)이어야 한다. 조정 (R^2)도 일반화 성능을 보장하지 않으므로 변수·하이퍼파라미터 선택은 검증 또는 교차검증과 함께 판단한다.

6. 잔차·영향력·다중공선성 진단

진단확인할 패턴가능한 원인대응 방향
잔차-적합값곡선, 부채꼴, 집단별 띠비선형, 이분산, 누락 집단변환·상호작용·가중·다른 모형
Q-Q 그림중앙 이탈, 두꺼운 꼬리, 극단점비정규 오차, 이상값, 혼합집단자료 확인, 강건 추론·모형 재지정
잔차-순서·시간연속된 양·음의 잔차, 주기자기상관, 추세·계절 누락시간 구조·시계열 검증 반영
레버리지·Cook 거리설명변수 공간의 극단점과 큰 영향입력 오류, 희귀하지만 실제인 사례원인 확인, 민감도 분석, 임의 삭제 금지
VIF특정 설명변수의 큰 분산팽창설명변수 간 강한 선형관계목적에 따라 변수 결합·제거·규제

다중공선성은 예측을 반드시 나쁘게 만들지는 않지만 개별 계수의 분산과 해석 안정성을 해칠 수 있다. 설명변수 (x_j)를 나머지 설명변수로 회귀한 결정계수를 (R_j^2)라 하면 분산팽창계수는 다음과 같다.

[ VIF_j=\frac{1}{1-R_j^2} ]

통상 절편을 포함한 보조회귀에서 (0\le R_j^2<1)이면 (VIF_j\ge1)이다. (R_j^2=0)이면 VIF는 1이고, 완전 다중공선성으로 (R_j^2=1)이면 분모가 0이 되어 무한대로 발산한다. VIF 5 또는 10 같은 값은 경험적 점검 기준이지 모든 분야의 자동 삭제 규칙이 아니다.

Cook 거리나 레버리지가 크다는 이유만으로 관측치를 삭제하지 않는다. 입력 오류인지, 모집단의 실제 희귀 사례인지 확인하고 포함·제외 결과의 민감도를 비교한다.

7. 규제 회귀

절편을 제외한 계수에 벌점을 주는 대표 목적함수는 다음과 같다.

[ \text{Ridge: }SSE+\lambda\sum_{j=1}^{p}b_j^2,\qquad \text{Lasso: }SSE+\lambda\sum_{j=1}^{p}|b_j|,\qquad \lambda\ge0 ]

구분벌점계수 효과적합한 상황·주의점
리지L2, 제곱합대체로 0에 가깝게 축소하되 정확히 0은 드묾상관된 변수와 안정적 예측, 변수 선택 효과는 약함
라쏘L1, 절댓값합일부 계수를 정확히 0으로 만들 수 있음희소화·변수 선택, 상관 변수 중 선택이 불안정할 수 있음

(\lambda=0)이면 규제 없는 최소제곱과 같고, (\lambda)가 커질수록 축소가 강해진다. 규제는 편향을 도입하는 대신 분산을 줄여 검증 예측을 개선할 수 있다.

변수 단위가 다르면 같은 크기의 계수 벌점이 공정하지 않으므로 대개 훈련 범위에서 표준화한다. 절편은 보통 벌점에서 제외한다. 표준화 기준과 (\lambda)는 각 교차검증 훈련 폴드 안에서 적합·선택하고 테스트 데이터는 사용하지 않는다.

8. 선형회귀 구축·진단 절차

  1. 연속형 목표, 예측 시점과 해석·예측 목적을 확정한다.
  2. 기준 범주, 단위, 사전에 정한 변환·상호작용과 데이터 분할을 정의한다.
  3. 훈련 범위에서 결측 처리·인코딩·표준화와 모형을 적합한다.
  4. 잔차의 곡선·부채꼴·시간 패턴, 영향점과 VIF를 진단한다.
  5. 평균 구조 재지정, 변환, 강건 표준오차·가중회귀 또는 규제를 목적에 맞게 비교한다.
  6. 검증에서 MAE·RMSE·안정성과 해석 가능성을 비교하고 선택 규칙을 잠근다.
  7. 독립 테스트에서 일반화 성능을 평가하고 외삽 범위와 구간 불확실성을 보고한다.

진단 결과를 보고 모형을 수정하는 일은 후보 선택에 해당한다. 따라서 진단·수정은 훈련·검증 범위에서 수행하고 테스트 결과에 맞춰 반복하지 않는다.

9. 사례 적용: 주택가격 예측

상황: 주택 면적, 연식, 역 거리와 방 수로 거래가격을 예측한다. 고가 주택에서 잔차 분산이 커지고 면적과 방 수의 상관이 높다.

판단 과정:

  1. 가격의 로그변환과 면적의 곡선항이 잔차 구조를 개선하는지 훈련·검증 범위에서 비교한다.
  2. 잔차-적합값의 부채꼴을 확인한다. 추론 목적이면 통상 표준오차와 강건 표준오차를 비교하고, 예측 목적이면 가격 구간별 MAE·RMSE와 예측구간 폭을 본다.
  3. 면적과 방 수의 VIF, 계수 부호와 폴드별 안정성을 확인한다.
  4. 표준화한 리지·라쏘의 (\lambda)를 교차검증으로 선택하고 규제 없는 기준모형과 같은 검증 조건에서 비교한다.
  5. 훈련 면적 범위를 벗어난 초대형 주택은 외삽임을 표시한다.

결론: 선형회귀를 해석 가능한 기준모형으로 사용하되 평균 구조, 오차 구조, 영향점, 다중공선성과 외삽을 분리해 진단한다.

오답 함정: 높은 훈련 (R^2)만으로 일반화·정규성·인과성을 모두 확인했다고 보거나, 큰 VIF·Cook 거리만으로 변수를 자동 삭제하지 않는다.

다섯 관측치와 y=1.3+0.9x 적합선을 그리고 실제값과 예측값의 세로 차이를 잔차로 표시한 그래프
다섯 관측치와 y=1.3+0.9x 적합선을 그리고 실제값과 예측값의 세로 차이를 잔차로 표시한 그래프
\hat y_i=1.3+0.9x_i, e_i=y_i-\hat y_i, SSE=Σ_i e_i^2=1.90

잔차는 실제값에서 적합값을 뺀 세로 차이다. 절편을 포함한 이 OLS 예제에서 잔차 합은 0이고, 제곱합은 1.90이다.

잔차가 무작위로 흩어진 양호 패턴, 곡선형 비선형성, 부채꼴 이분산 징후를 비교한 세 패널
잔차가 무작위로 흩어진 양호 패턴, 곡선형 비선형성, 부채꼴 이분산 징후를 비교한 세 패널
잔차 패턴우선 의심대응 방향
0 주변 무작위평균 구조가 대체로 적절다른 진단도 확인
곡선비선형·누락항변환·다항·상호작용
부채꼴이분산변환·가중·강건 표준오차

패턴은 원인을 확정하는 증거가 아니라 추가 진단의 출발점이다.

시험 판단 포인트

  • 선형회귀는 연속형 목표의 조건부 평균을 계수의 선형결합으로 추정한다.
  • 최소제곱은 잔차제곱합을 최소화하며 극단 오차의 영향이 크다.
  • 회귀계수는 다른 변수를 고정한 조건부 관계이고 인과효과를 자동 보장하지 않는다.
  • 정규성은 설명변수 자체가 아니라 주로 조건부 오차와 소표본 추론에 관련된다.
  • 이분산은 통상 표준오차와 효율에 영향을 줄 수 있으나 OLS 계수가 언제나 편향된다는 뜻은 아니다.
  • 검증·테스트 (R^2)는 음수가 될 수 있고 (SST=0)이면 정의에 주의한다.
  • 다중공선성은 개별 계수의 분산·안정성에 영향을 주며 예측을 반드시 악화시키지는 않는다.
  • 리지·라쏘는 훈련 폴드에서 표준화하고 (\lambda)를 검증으로 선택한다.

자주 틀리는 부분

  • 선형을 설명변수와 목표의 원자료 관계가 반드시 직선이라는 뜻으로 한정하지 않는다.
  • 잔차와 관측되지 않은 모집단 오차를 같은 것으로 보지 않는다.
  • 높은 (R^2)를 낮은 MAE·RMSE, 좋은 외부 예측 또는 인과성의 증거로 보지 않는다.
  • 강건 표준오차가 비선형 평균 구조와 이상값을 모두 수정한다고 보지 않는다.
  • 예측구간을 평균반응 신뢰구간과 같은 폭으로 해석하지 않는다.
  • VIF 임곗값만으로 설명변수를 자동 삭제하지 않는다.
  • 테스트 데이터로 변환, 변수 또는 규제 강도 (\lambda)를 선택하지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01\(x=[1,2,3,4,5]\), \(y=[2,3,5,4,6]\)인 단순회귀의 기울기와 절편은?
정답 및 해설

(b_1=0.9,\ b_0=1.3)

(\bar{x}=3), (\bar{y}=4), (S_{xx}=10), (S_{xy}=9)이므로 (b_1=9/10=0.9), (b_0=4-0.9\times3=1.3)이다.

02결정계수 \(R^2\)에 관해 올바르게 설명하시오.
정답 및 해설

검증 데이터에서 평균 예측보다 성능이 나쁘면 (R^2)가 음수일 수 있다.

검증·테스트에서 모형의 SSE가 해당 세트의 평균 기준 SST보다 크면 (R^2=1-SSE/SST<0)이 된다.

03잔차-적합값 그래프가 부채꼴이고 외생성과 평균 모형은 타당하다고 가정한다. 어떻게 판단해야 하는지 근거와 함께 서술하시오.
정답 및 해설

OLS 계수가 반드시 편향된다고 단정하지 말고 이분산에 따른 표준오차·효율과 예측 불확실성을 점검한다.

이분산은 오차 분산이 설명변수·적합값 수준에 따라 달라지는 현상이다. 외생성과 평균 모형이 맞다면 OLS 계수가 자동으로 편향되는 것은 아니지만 통상 표준오차, 효율과 구간별 예측 불확실성에 문제가 생길 수 있다.

04리지와 라쏘 적용에 관해 올바르게 설명하시오.
정답 및 해설

변수 단위를 훈련 폴드에서 맞추고 (\lambda)를 검증으로 선택하며, 라쏘는 일부 계수를 0으로 만들 수 있다.

규제 벌점은 변수 단위에 영향을 받으므로 훈련 폴드에서 표준화하고 (\lambda)를 검증으로 선택한다. 라쏘의 L1 벌점은 일부 계수를 정확히 0으로 만들 수 있다.