군집분석과 군집 품질
주요 군집 알고리즘의 가정과 군집 품질 평가 기준을 익힌다.
핵심 요약
군집분석은 미리 주어진 정답 클래스를 예측하지 않고 데이터의 잠재적 집단 구조를 탐색한다. 같은 데이터도 분석 단위, 변수, 전처리, 거리, 알고리즘과 하이퍼파라미터에 따라 다른 군집이 나온다. 따라서 군집 번호는 이름표일 뿐 순서·등급·우수도를 뜻하지 않으며, 하나의 내부지표만으로 “참 군집”을 확정하지 않는다.
k-평균은 군집 내 제곱거리 합(WCSS)을 줄이고, 계층적 군집은 연결 기준에 따른 병합·분할 구조를 덴드로그램으로 표현한다. DBSCAN은 밀도 연결 영역을 군집으로 만들고 희소한 점을 잡음으로 분리한다. 선택한 방법의 가정과 실패 조건을 품질평가에 함께 반영해야 한다.
학습 목표
- 분석 단위·변수·거리척도가 군집의 의미를 어떻게 결정하는지 설명한다.
- k-평균의 목적함수, 반복 절차, 수렴 성질과 한계를 계산·판단한다.
- 계층적 군집의 연결 기준과 Ward 방법의 조건을 구분한다.
- DBSCAN의 핵심점·경계점·잡음과
eps·MinPts효과를 설명한다. - WCSS·실루엣·DB·CH·외부지표·안정성의 방향과 경계를 구분한다.
- 지표와 업무 제약을 결합해 군집 수와 운영 가능한 군집을 선택한다.
1. 문제 정의와 전처리
입력은 보통 n개 관측치 × p개 특징 행렬이고, 출력은 군집 라벨·중심·계층 구조·잡음 여부 등이다. 고객을 묶는지, 주문을 묶는지처럼 행의 단위가 달라지면 같은 변수라도 군집 의미가 달라진다. 변수는 “가까움”의 정의를 만들므로 목적에 맞는 변수만 사용하고 식별자·사후 결과·미래 정보가 거리 계산에 들어가는 데이터 누수를 막는다.
| 점검 대상 | 위험 | 대응 예 |
|---|---|---|
| 단위·분산이 다른 수치형 | 큰 단위 변수가 거리를 지배 | 표준화, 로버스트 스케일링 |
| 극단값·긴 꼬리 | 평균 중심과 거리 왜곡 | 로그 변환, 윈저화 검토, 강건 방법 비교 |
| 범주형 | 평균·유클리드 거리가 부적절 | k-modes, 적합한 범주 거리 |
| 수치형+범주형 혼합 | 한 자료형이 결과를 지배 | Gower 거리, k-prototypes 등 |
| 결측 | 거리와 표본 구성이 달라짐 | 원인 진단 후 대치·결측 지시자·제외 기준 명시 |
| 고차원 | 거리가 비슷해지는 차원의 저주 | 변수 선택, PCA 등 축소와 안정성 비교 |
전처리는 전체 데이터에 미리 맞추지 않는다. 새 데이터 성능이나 시간 안정성을 평가할 때 스케일링·대치·차원축소의 파라미터는 분석용 데이터에서 추정하고 평가 데이터에는 그대로 적용한다.
거리 선택
수치형 벡터 x, y에 대해 대표적인 비유사도는 다음과 같다.
유클리드 거리: d₂(x,y) = √Σⱼ(xⱼ-yⱼ)²
맨해튼 거리: d₁(x,y) = Σⱼ|xⱼ-yⱼ|
코사인 거리: dcos(x,y) = 1 - (x·y)/(||x|| ||y||)
- k-평균의 표준 목적함수는 제곱 유클리드 거리와 평균 중심의 조합이다.
- 맨해튼 거리는 좌표별 절대차를 쓰며 제곱거리보다 큰 편차의 영향이 작다.
- 코사인 거리는 크기보다 방향이 중요한 문서·빈도 벡터 등에 유용하지만 영벡터에서는 분모가 0이므로 별도 처리가 필요하다.
- 혼합형에는 변수별 범위를 조정한 Gower 거리 등을 검토한다.
2. k-평균 군집
관측치 xᵢ, 군집 Cₖ, 중심 μₖ에 대한 목적함수는 다음과 같다.
WCSS = Σₖ Σᵢ∈Cₖ ||xᵢ - μₖ||²
고정된 할당에서는 군집 평균이 제곱거리 합을 최소화한다. 표준 반복은 다음과 같다.
K개 중심을 초기화한다.- 각 관측치를 가장 가까운 중심에 할당한다.
- 각 군집의 평균으로 중심을 갱신한다.
- 할당 또는 목적함수 변화가 충분히 작거나 반복 상한에 도달할 때까지 2~3을 반복한다.
각 할당·갱신 단계에서 WCSS는 증가하지 않으며 유한한 할당 중 하나에서 멈춘다. 그러나 이는 지역 최적해 수렴이지 전역 최적해 보장이 아니다. k-means++ 초기화와 여러 재시작 결과를 비교하고, 빈 군집 처리 방식은 구현체별 설정을 확인한다.
k-평균은 대체로 구형이고 분산·크기가 비슷한 군집에서 잘 작동한다. 길게 휘어진 모양, 밀도가 크게 다른 집단, 극단값, 범주형 원자료에는 취약하다. K를 늘리면 WCSS는 항상 감소하거나 같고, K=n이면 각 관측치를 하나씩 두어 WCSS가 0이 될 수 있으므로 WCSS 최솟값만으로 K를 선택할 수 없다.
3. 계층적 군집
응집형은 각 관측치를 하나의 군집으로 시작해 반복적으로 병합하고, 분할형은 전체를 시작점으로 나눈다. 응집형에서 한번 이루어진 병합은 뒤 단계에서 되돌리지 않는다. 덴드로그램의 높이는 해당 연결 기준의 병합 비유사도를 나타내며, 자르는 높이에 따라 군집 수가 달라진다.
| 연결 기준 | 두 군집 사이 기준 | 대표 성질·주의점 |
|---|---|---|
| 단일연결 | 가장 가까운 점 쌍의 거리 | 비구형 구조 가능, 사슬 효과와 잡음 연결 위험 |
| 완전연결 | 가장 먼 점 쌍의 거리 | 조밀한 군집 선호, 극단점에 민감 |
| 평균연결 | 모든 교차 점 쌍 거리의 평균 | 단일·완전의 중간 성격 |
| Ward | 병합으로 증가하는 군집 내 제곱합 | 구형·분산 유사 군집 선호, 통상 유클리드/제곱 유클리드 구조에서 사용 |
Ward를 임의의 거리와 자유롭게 결합할 수 있다고 해석하면 안 된다. 또한 서로 다른 연결 기준의 덴드로그램 높이를 같은 숫자 척도처럼 직접 비교하기보다, 각 기준에서 절단 결과·안정성·해석을 비교한다.
4. DBSCAN 밀도기반 군집
DBSCAN은 반경 eps 이내의 이웃 수로 밀도를 판단한다. 많은 구현과 교재의 관례에서 점 자신도 이웃 수에 포함하므로 실제 사용하는 라이브러리 정의를 확인한다.
| 점 유형 | 정의와 역할 |
|---|---|
| 핵심점 | eps 이웃에 자신을 포함해 MinPts개 이상이 있는 점 |
| 경계점 | 핵심점은 아니지만 어떤 핵심점의 eps 이웃에 있는 점 |
| 잡음점 | 어느 핵심점에서도 밀도 도달할 수 없는 점 |
서로 밀도 연결된 핵심점들과 그 경계점이 군집을 이룬다. DBSCAN은 K를 미리 정하지 않고 임의 모양 군집과 잡음을 찾을 수 있다. 반면 eps가 너무 작으면 잡음이 늘고, 너무 크면 군집이 합쳐진다. MinPts가 커질수록 더 조밀한 영역을 요구한다. 하나의 설정으로 밀도가 크게 다른 군집을 찾기 어렵고, 고차원에서는 거리 구별력이 약해진다. 잡음 라벨 -1 같은 표기는 구현체 관례이지 수학적 정의가 아니다.
5. 군집 수와 품질 평가
WCSS와 엘보
다음 1차원 데이터 x={0,2,8,10}을 보자.
K=1: 평균 5,WCSS=25+9+9+25=68K=2:{0,2},{8,10}, 중심 1과 9,WCSS=(1+1)+(1+1)=4K=3: 한 쌍과 두 단일점, 최적WCSS=2K=4: 각 점이 한 군집,WCSS=0
xychart-beta
title "예시 데이터의 K별 WCSS"
x-axis "K" [1, 2, 3, 4]
y-axis "WCSS" 0 --> 70
bar [68, 4, 2, 0]
이 예에서는 1→2의 감소가 매우 크고 이후 개선이 작아 K=2가 엘보 후보가 된다. 엘보는 시각적·상대적 판단이므로 단독 확정 기준이 아니다.
실루엣 계수
관측치 i에 대해 a(i)는 같은 군집의 다른 점까지 평균거리이고, b(i)는 각 다른 군집까지의 평균거리 중 최솟값이다.
s(i) = [b(i)-a(i)] / max[a(i), b(i)], -1 ≤ s(i) ≤ 1
1에 가까우면 자기 군집 안에서는 가깝고 다른 군집에서는 멀다. 0 근처는 경계·중첩, 음수는 다른 군집에 더 가까울 가능성을 뜻한다. 군집이 하나뿐이면 b(i)가 없어 정의할 수 없다. 단일점 군집의 실루엣은 이론적으로 별도 관례가 필요하며 많은 구현은 0으로 둔다. 거리들이 모두 0인 특수 경우도 구현 규칙을 확인한다.
앞의 K=2에서 점 0은 a=2, 다른 군집까지 평균거리 b=(8+10)/2=9이므로 s=(9-2)/9=7/9≈0.778이다. 네 점의 평균 실루엣은
[7/9 + 5/7 + 5/7 + 7/9] / 4 = 47/63 ≈ 0.746
으로 직접 검산할 수 있다.
지표의 방향과 한계
| 지표 | 좋은 방향 | 주요 경계·해석 |
|---|---|---|
| WCSS | 낮음 | K가 늘면 비증가하므로 단독 비교 금지 |
| 평균 실루엣 | 높음, 범위 [-1,1] | 적어도 2개 군집 필요, 거리·군집 모양에 의존 |
| Davies–Bouldin(DB) | 낮음, 0 이상 | 군집 내 산포와 중심 간 분리 비교, 적어도 2개 군집 필요 |
| Calinski–Harabasz(CH) | 높음 | 군집 간/내 분산비, 보통 2≤K≤n-1에서 비교 |
| ARI·NMI | 높음 | 외부 정답·기준 라벨이 있을 때만 외부 평가에 사용 |
내부지표가 좋아도 업무상 의미가 없거나 재표본에서 군집이 무너지면 좋은 해가 아니다. 반대로 외부 기준 라벨은 군집 학습에 사용하지 않았더라도 사후 외부평가에는 사용할 수 있다. ARI·NMI는 군집 번호가 서로 바뀌어도 구조 비교가 가능하다.
선택 절차
- 목적과 운영 가능한 군집 수·최소 크기·접근 채널을 정의한다.
- 전처리·거리·알고리즘 후보별로 여러 하이퍼파라미터를 적합한다.
- 엘보·실루엣·DB·CH를 같은 전처리와 표본 조건에서 비교한다.
- 재표본·초깃값·시간 구간을 바꿔 군집 일치도와 프로파일 안정성을 본다.
- 군집별 크기·특징·이상점·민감정보·공정성 위험을 해석한다.
- 새 관측치의 할당·재학습 규칙과 업무 행동의 증분효과를 검증한다.
6. 사례 적용
상황: 구매빈도, 최근구매경과일, 평균금액으로 고객을 세분화한다.
조건: 평균금액 단위가 크고 소수 초고액 고객이 있으며, 캠페인은 최소 500명 집단에만 운영할 수 있다.
판단: 분석 시점 뒤의 구매성과는 변수에서 제외한다. 금액 로그 변환과 로버스트 스케일링을 비교하고 k-평균의 K·재시작, 계층적 연결, DBSCAN 설정을 탐색한다. 내부지표뿐 아니라 재표본·다음 분기 프로파일 안정성, 500명 최소 크기, 초고액 집단이 군집인지 잡음인지, 각 집단에 실행 가능한 메시지가 있는지를 확인한다.
결론: 실루엣이 가장 큰 해가 80명짜리 군집을 만들고 다른 해가 약간 낮은 실루엣으로 안정적인 500명 이상 군집을 만든다면, 업무 제약과 안정성을 포함해 후자를 선택할 수 있다. 최종 군집 이름은 프로파일을 보고 붙이며 번호 자체를 등급으로 해석하지 않는다.
같은 점도 거리·스케일·알고리즘 가정에 따라 다른 군집이 된다. k-평균은 중심 주위의 구형 군집에 잘 맞는 편이고, 비구형·잡음 구조에는 밀도·연결 기반 방법을 검토한다.
| 기호 | 의미 | 좋은 방향 |
|---|---|---|
| a(i) | 같은 군집 내 평균 거리 | 작음 |
| b(i) | 가장 가까운 다른 군집 평균 거리 | 큼 |
| s(i) | 응집·분리의 상대 지표 | 1에 가까움 |
평균 실루엣이 최대인 k는 후보일 뿐이며 반복 표본 안정성·업무 해석·활용 가능성을 함께 본다.
시험 판단 포인트
- k-평균은 제곱 유클리드 거리와 평균 중심으로 WCSS를 줄이지만 전역 최적을 보장하지 않는다.
- WCSS는
K증가에 따라 감소하거나 같으므로 최솟값만으로 군집 수를 고르지 않는다. - Ward는 병합 시 군집 내 제곱합 증가를 최소화하며 임의 거리와의 조합으로 보지 않는다.
- DBSCAN은 핵심점·경계점·잡음을 구분하고
K대신eps·MinPts를 정한다. - 실루엣은 높을수록, DB는 낮을수록, CH는 높을수록 좋다는 방향을 구분한다.
- 내부지표·외부지표·안정성·프로파일·업무 실행 가능성을 함께 본다.
자주 틀리는 부분
- 군집 번호를 서열·고객등급으로 해석하지 않는다.
K를 늘려 WCSS가 낮아진 것만으로 모델이 좋아졌다고 단정하지 않는다.- 단일점 군집이나 한 개 군집에서 실루엣을 일반식 그대로 무조건 계산하지 않는다.
- DBSCAN이 모든 밀도와 고차원 데이터에 자동으로 적합하다고 보지 않는다.
- 범주형·혼합형 원자료에 표준 k-평균을 그대로 적용하지 않는다.
- 시각적으로 예쁜 분리나 내부지표 하나를 실제 활용 가치와 동일시하지 않는다.
개념 확인 문제
문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.
01x={0,2,8,10}을 {0,2}와 {8,10}으로 나눌 때 k-평균 WCSS는?
4
두 중심은 1과 9이므로 WCSS=(0-1)²+(2-1)²+(8-9)²+(10-9)²=1+1+1+1=4다.
02위 군집에서 점 0의 실루엣 계수는? (a=2, b=9)
7/9≈0.778
실루엣은 (b-a)/max(a,b)이므로 (9-2)/9=7/9≈0.778이다. 양수이고 1에 가까워 이 점은 현재 군집 안에서 가깝고 다른 군집에서 멀다.
03DBSCAN에 관해 타당한 내용을 설명하시오.
eps와 MinPts로 핵심점·경계점·잡음을 구분한다.
DBSCAN은 K 대신 반경 eps와 최소 이웃 수 MinPts로 밀도 구조를 정하고 핵심점·경계점·잡음을 구분한다.
04Ward 연결에 관해 타당한 내용을 설명하시오.
병합으로 증가하는 군집 내 제곱합을 작게 하는 쌍을 선택한다.
Ward 연결은 두 군집을 합칠 때 증가하는 군집 내 제곱합이 작은 병합을 선택하며 보통 유클리드/제곱 유클리드 구조와 연결된다.