서포트벡터머신과 마진
SVM의 마진·커널 원리와 주요 하이퍼파라미터를 익힌다.
핵심 요약
서포트벡터머신(SVM)은 두 클래스 사이의 간격인 마진을 최대화하는 결정 초평면을 찾는 지도학습 알고리즘이다. 표준화된 선형 SVM에서 결정경계는 wᵀx+b=0, 두 마진 경계는 wᵀx+b=±1이며 전체 마진 폭은 2/‖w‖다.
현실 자료는 완전히 분리되지 않는 경우가 많다. 소프트 마진 SVM은 슬랙변수와 힌지손실로 마진 안의 점과 오분류를 허용하고, C로 마진 폭과 위반 벌점의 균형을 조절한다. 커널 SVM은 입력을 직접 고차원으로 펼치지 않고 커널 내적으로 비선형 경계를 만든다.
학습 목표
- 결정함수·기하학적 거리와 표준화된 마진 폭을 계산한다.
- 하드 마진·소프트 마진, 슬랙값과 힌지손실을 구분한다.
- 쌍대식에서 서포트벡터와 커널의 역할을 설명한다.
C, RBFγ, 다항 차수와 전처리를 교차검증으로 선택한다.- 확률 보정·다범주 확장·불균형·SVR·계산 복잡성의 경계를 판정한다.
1. 결정함수와 기하학적 마진
이진 레이블을 y∈{-1,+1}로 두면 선형 SVM의 결정함수와 예측은 다음과 같다.
f(x) = wᵀx + b
ŷ = sign(f(x))
점 x에서 결정 초평면까지의 기하학적 거리는 |f(x)|/‖w‖다. w,b를 같은 양수로 배율 조정해도 결정경계는 같으므로, 하드 마진에서는 가장 가까운 점이 yᵢf(xᵢ)=1을 만족하도록 표준화한다.
결정경계: wᵀx+b = 0
양성 마진 경계: wᵀx+b = +1
음성 마진 경계: wᵀx+b = -1
한쪽 거리: 1/‖w‖, 전체 마진 폭: 2/‖w‖
flowchart TB
P["양성 마진 경계: f(x)=+1"] ---|"거리 1/‖w‖"| H["결정경계: f(x)=0"]
H ---|"거리 1/‖w‖"| N["음성 마진 경계: f(x)=-1"]
SP["양성 서포트벡터"] -. "경계에 접함" .-> P
SN["음성 서포트벡터"] -. "경계에 접함" .-> N
예를 들어 w=(3,4)이면 ‖w‖=5이므로 표준화된 전체 마진 폭은 2/5=0.4다. b=-5, x=(2,1)이면 f(x)=3×2+4×1-5=5, 초평면까지 거리는 |5|/5=1이고 양성으로 분류한다.
2. 하드 마진과 소프트 마진
2.1 하드 마진
훈련 자료가 특징공간에서 선형 분리 가능할 때 다음 문제를 푼다.
minimize ½‖w‖²
subject to yᵢ(wᵀxᵢ+b) ≥ 1 for all i
‖w‖를 작게 하는 것은 마진 폭 2/‖w‖을 크게 하는 것과 같다. 하드 마진은 한 점의 이상치나 클래스 겹침에도 제약이 불가능해질 수 있어 현실 자료에 민감하다.
2.2 소프트 마진과 슬랙
슬랙변수 ξᵢ≥0을 도입해 제약 위반을 허용한다.
minimize ½‖w‖² + CΣξᵢ
subject to yᵢf(xᵢ) ≥ 1-ξᵢ, ξᵢ ≥ 0
최소 슬랙은 힌지손실과 같다.
ξᵢ = max(0, 1-yᵢf(xᵢ))
yᵢf(xᵢ) | 최소 ξᵢ | 위치·판정 |
|---|---|---|
≥1 | 0 | 올바른 쪽이며 마진 경계 위 또는 바깥 |
0<값<1 | 1-yᵢf(xᵢ) | 올바르게 분류됐지만 마진 안 |
0 | 1 | 결정경계 위 |
<0 | >1 | 오분류 |
예를 들어 yᵢf(xᵢ)=0.4이면 분류 부호는 맞지만 마진 안에 있고 ξᵢ=0.6이다. yᵢf(xᵢ)=-0.3이면 오분류이며 ξᵢ=1.3이다.
C가 크면 위반을 강하게 벌해 더 좁은 마진과 복잡한 적합으로 갈 수 있고, 작으면 위반을 더 허용해 넓은 마진과 단순한 경계로 갈 수 있다. 이는 일반적 경향이지 모든 자료에서 성능을 단조롭게 결정하는 법칙은 아니다. 구현에 따라 손실의 합·평균과 규제 표기가 달라 C와 λ의 수치 관계에는 표본 수 등의 상수가 들어갈 수 있으므로 단순히 항상 λ=1/C라고 단정하지 않는다.
3. 서포트벡터와 쌍대 표현
선형·커널 SVM의 결정함수는 쌍대계수로 다음처럼 쓸 수 있다.
f(x) = Σᵢ αᵢyᵢK(xᵢ,x) + b
αᵢ>0인 훈련점이 서포트벡터이며 경계를 직접 결정한다. 하드 마진에서는 보통 마진 경계에 접한 점이 서포트벡터다. 소프트 마진에서는 경계에 접한 점뿐 아니라 마진 안의 점과 오분류점도 서포트벡터가 될 수 있다. αᵢ=0인 먼 점은 고정된 최적해에서 결정함수 합에 직접 기여하지 않는다.
서포트벡터는 클래스 평균이나 중심점이 아니다. 데이터가 바뀌면 서포트벡터 집합과 경계도 바뀔 수 있으며, 서포트벡터 수가 많으면 예측 비용과 모델 복잡성이 커질 수 있다.
4. 커널 트릭
커널은 특징변환 φ(x)를 명시적으로 계산하지 않고 내적 K(x,z)=φ(x)ᵀφ(z)를 계산한다.
| 커널 | 대표 식 | 주요 하이퍼파라미터·특징 |
|---|---|---|
| 선형 | xᵀz | 고차원 희소 자료와 선형 경계의 기준모형 |
| 다항 | (γxᵀz+r)ᵈ | 차수 d, γ, 상수항 r; 상호작용 표현 |
| RBF | exp(-γ‖x-z‖²) | γ>0; 거리 기반 국소 비선형 경계 |
| sigmoid | tanh(γxᵀz+r) | 모든 설정이 유효 커널인 것은 아니므로 구현 확인 |
커널은 임의의 유사도 함수가 아니다. 학습 문제를 안정적으로 정의하려면 커널 행렬이 대칭 양의 준정부호가 되는 등 유효 커널 조건을 만족해야 한다.
RBF에서 γ가 크면 거리가 조금만 멀어져도 커널값이 빠르게 작아져 영향 범위가 좁고 경계가 복잡해질 수 있다. γ가 작으면 영향 범위가 넓고 경계가 부드러워질 수 있다. 영향 길이 척도는 대략 1/√γ에 비례하지만 정확한 해석은 식의 계수 관례에 따라 달라진다.
5. 스케일링과 하이퍼파라미터 탐색
RBF·다항 커널은 거리·내적을 사용하고 선형 SVM도 규제와 계수 크기가 변수 단위의 영향을 받는다. 한 변수가 01, 다른 변수가 0100000이면 큰 범위 변수가 경계를 지배할 수 있다.
- 표준화·결측 대체·범주 인코딩은 각 훈련 폴드에서만 학습한다.
C와γ는 여러 자릿수에 걸쳐 민감할 수 있어 보통 로그 간격 후보를 비교한다.- 커널 종류, 다항 차수·상수항도 검증 대상이다.
- 클래스 가중치와 재표본추출도 훈련 폴드 안에서 적용한다.
- 최종 테스트는 모든 선택을 고정한 뒤 한 번 평가한다.
| 설정 | 일반적 복잡도 경향 | 위험 |
|---|---|---|
큰 C, 큰 RBF γ | 위반을 강하게 벌하고 국소 영향 | 훈련점·잡음에 세밀하게 적합 |
작은 C, 작은 RBF γ | 위반 허용과 넓은 영향 | 지나치게 단순한 경계 |
큰 C, 작은 γ | 위반 벌점은 강하나 경계는 부드러움 | 상호작용을 검증해야 함 |
작은 C, 큰 γ | 국소 커널이나 위반 허용 | 단일 축만으로 결과 예측 불가 |
C와 γ는 상호작용하므로 한 값만 고정해 순차 판단하기보다 결합 탐색한다. 검증 자료를 반복해서 많이 탐색하면 검증에도 과적합할 수 있다.
6. 분류 점수·확률과 다범주
결정함수 f(x)의 부호는 클래스, 절댓값은 경계에서의 상대적 여유를 나타내지만 기본적으로 확률이 아니다. 커널·규제·스케일이 다르면 점수 크기를 그대로 비교하기도 어렵다.
확률이 필요하면 sigmoid 기반 Platt 보정이나 isotonic 보정 등을 훈련·검증 범위에서 적합하고, 독립 자료에서 Brier 점수·로그손실·보정곡선을 평가한다. 보정 자료가 작으면 유연한 isotonic 방식이 과대적합할 수 있다. 테스트 라벨로 보정하면 누수다.
K개 클래스를 여러 이진 문제로 확장할 수 있다.
| 전략 | 이진 분류기 수 | 특징 |
|---|---|---|
| 일대다(OVR) | K | 한 클래스와 나머지를 구분; 점수 비교 규칙 필요 |
| 일대일(OVO) | K(K-1)/2 | 클래스 쌍마다 학습; 투표·점수로 결합 |
라이브러리가 어떤 전략을 기본으로 사용하는지 확인한다. 출력 점수 배열의 모양과 확률 보정 방식도 구현별로 다를 수 있다.
7. 불균형·평가와 계산 한계
불균형 분류에서는 정확도만으로 판단하지 않고 정밀도·재현율·F1·PR-AUC, 클래스별 혼동행렬과 오류 비용을 본다. 클래스별 가중치는 사실상 위반 벌점을 다르게 만들어 경계를 바꿀 수 있다. 가중 SVM의 점수도 자동으로 보정된 확률이 되지는 않는다.
커널 SVM은 커널 행렬 저장·최적화 비용 때문에 표본 수가 매우 크면 시간·메모리 부담이 급격히 커질 수 있다. 정확한 복잡도는 구현·자료·수렴 설정에 따라 달라지지만 커널 행렬은 최대 n×n 규모다. 대규모 희소 자료에서는 선형 SVM, 확률적 선형 분류기, 근사 커널을 비교한다.
평가는 전처리를 포함한 전체 파이프라인을 교차검증한다. 시간·환자·문서 출처처럼 집단 구조가 있으면 이에 맞는 분할을 사용하고, 여러 시드·폴드의 변동을 보고한다.
8. 서포트벡터 회귀(SVR)
SVR은 연속형 목표를 예측하며 예측 오차가 ε 이내인 ε-튜브에서는 손실을 0으로 둔다.
Lε(y,f(x)) = max(0, |y-f(x)|-ε)
| 하이퍼파라미터 | SVR에서의 의미 |
|---|---|
ε | 손실 없이 허용하는 오차 튜브의 반폭; 크면 더 많은 점이 튜브 안 |
C | 튜브 밖 위반의 벌점; 크면 큰 오차를 더 강하게 억제 |
γ | RBF 사용 시 영향 범위와 함수 복잡성 조절 |
튜브 바깥 또는 경계의 점이 회귀함수를 결정하는 서포트벡터가 될 수 있다. 목표값 스케일이 ε의 의미와 C 선택에 영향을 주므로 입력뿐 아니라 목표 스케일과 업무 허용오차를 함께 본다. 평가는 MAE·RMSE 등으로 수행한다.
9. 사례 적용
상황: 수백 개 단어 빈도로 문서를 네 범주로 분류한다. 자료는 희소하고 클래스 비율이 다르다.
판단 과정:
- 문서 출처가 겹치지 않도록 훈련·검증·테스트를 나누고 어휘·가중치 변환을 훈련 폴드에서 학습한다.
- 고차원 희소 특성에 선형 SVM을 기준 후보로 둔다.
- 클래스 가중치와
C를 교차검증하고 클래스별 재현율·정밀도·PR-AUC를 본다. - 비선형 필요성이 확인될 때만 RBF 후보의
C·γ를 결합 탐색하고 계산비용을 비교한다. - 확률이 필요하면 검증 범위에서 보정하고 Brier 점수·보정곡선으로 확인한다.
- OVR·OVO 전략과 여러 폴드의 성능 변동을 보고한 뒤 테스트를 한 번 평가한다.
결론: 커널 복잡성을 자동으로 높이지 않고 데이터 구조, 오류 비용, 확률 필요성과 계산 자원에 맞는 후보를 선택한다.
결정경계에 가장 가까운 관측치가 서포트벡터이며 마진을 결정한다. 소프트 마진의 $C$가 크면 위반을 강하게 벌점화하고, 작으면 더 많은 위반을 허용해 규제를 강화한다.
| 커널 | 핵심 모수 | 주의 |
|---|---|---|
| 선형 | C | 고차원 희소 자료에 유용 |
| 다항 | 차수·계수 | 차수가 크면 복잡도 증가 |
| RBF | C·γ | γ가 크면 국소적·과대적합 위험 |
커널은 입력공간을 직접 그리는 장식이 아니라 특성공간 내적을 계산하는 함수다.
시험 판단 포인트
- 표준화된 선형 SVM의 결정경계는
f(x)=0, 마진 경계는f(x)=±1, 폭은2/‖w‖다. - 하드 마진은
yᵢf(xᵢ)≥1, 소프트 마진은 슬랙으로 위반을 허용한다. 0<ξ<1은 올바르게 분류됐지만 마진 안,ξ>1은 오분류다.- 서포트벡터는 비영 쌍대계수로 결정함수에 기여하며 클래스 중심점이 아니다.
- 큰
C는 위반을 더 강하게 벌하고 큰 RBFγ는 영향 범위를 좁게 하는 일반적 경향이 있다. - 커널은 임의의 유사도가 아니며 유효 커널 조건이 필요하다.
- 결정함수 점수는 확률이 아니며 보정도 훈련·검증 범위에서 수행한다.
- OVR은 K개, OVO는
K(K-1)/2개의 이진 분류기를 사용한다. - SVR의 ε 안 오차는 손실이 0이다.
자주 틀리는 부분
- 마진 폭을
1/‖w‖로 쓰지 않는다. 이는 한쪽 거리이고 전체 폭은2/‖w‖다. - 소프트 마진의 서포트벡터를 마진 경계에 정확히 놓인 점으로만 한정하지 않는다.
C가 크면 마진이 항상 넓어진다고 해석하지 않는다.- 큰
γ가 항상 일반화를 개선한다고 보지 않는다. - 모든 유사도 함수를 커널로 사용할 수 있다고 보지 않는다.
- 전체 데이터로 스케일링·보정한 뒤 교차검증하지 않는다.
- SVM 점수를 이미 보정된 확률로 해석하지 않는다.
개념 확인 문제
문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.
01표준화된 선형 SVM에서 ‖w‖=5일 때 두 마진 경계 사이의 폭은?
0.4
02어떤 관측치의 yᵢf(xᵢ)=0.4일 때 최소 슬랙과 상태를 올바르게 제시하시오.
ξ=0.6, 올바르게 분류됐지만 마진 안에 있다.
03RBF 커널과 γ에 관해 올바르게 설명하시오.
γ가 커지면 일반적으로 한 관측치의 영향 범위가 좁아질 수 있다.
04SVM 결정점수를 실제 위험확률로 사용하려 할 때 적절한 절차를 순서대로 서술하시오.
훈련·검증 범위에서 보정 모형을 적합하고 독립 자료에서 보정도를 평가한다.