지도학습·비지도학습·강화학습
AI·머신러닝·딥러닝의 관계와 지도·비지도·강화학습의 데이터·목표·대표 문제를 구분한다.
1. AI·머신러닝·딥러닝의 관계
인공지능(AI)
├─ 규칙·탐색·지식표현
└─ 머신러닝(ML)
├─ 전통적 통계·트리·거리 기반 모델
└─ 딥러닝(DL)
└─ 여러 층의 신경망
- AI: 지능적 행동을 수행하도록 만드는 넓은 분야
- 머신러닝: 데이터에서 패턴을 학습하여 예측·판단 규칙을 만드는 방법
- 딥러닝: 다층 신경망을 이용하는 머신러닝 방법
모든 AI가 머신러닝인 것은 아니고, 모든 머신러닝이 딥러닝인 것도 아니다.
2. 학습과 추론
학습 단계
데이터 + 목표 + 알고리즘
↓
모델 파라미터
추론 단계
새 입력 + 학습된 모델
↓
예측·분류·생성
학습은 모델의 파라미터를 찾는 과정이고, 추론은 학습된 모델을 새 데이터에 적용하는 과정이다.
3. 특성과 레이블
- 특성(Feature): 예측에 사용하는 입력 변수
- 레이블(Label·Target): 맞히려는 정답
- 샘플: 한 관측 단위
- 모델: 입력에서 출력으로 가는 규칙
- 파라미터: 학습으로 결정되는 내부 값
- 하이퍼파라미터: 학습 전에 정하거나 검증으로 선택하는 설정
대출 심사 샘플
특성: 소득, 부채, 연체횟수, 근속기간
레이블: 상환 / 부도
4. 지도학습
입력과 정답 레이블이 함께 있는 데이터로 학습한다.
(특성 X, 정답 y) 여러 건
↓
모델 학습
↓
새 X에 대한 y 예측
대표 문제:
- 분류: 범주 예측
- 회귀: 연속 수치 예측
- 순위·확률 예측
예:
- 스팸 여부
- 장애 발생 여부
- 주택가격
- 처리시간
- 고객 이탈 확률
지도학습의 성능은 레이블 품질과 실제 운영 데이터와의 일치에 크게 영향을 받는다.
5. 비지도학습
정답 레이블 없이 데이터의 구조와 패턴을 찾는다.
특성 X만 존재
↓
유사성·분포·구조 탐색
↓
군집·차원축소·이상패턴
대표 문제:
- 군집화
- 차원축소
- 연관·패턴 탐색
- 이상치 탐지
- 표현 학습
예:
- 유사 고객군 분류
- 시스템 로그 패턴 탐색
- 고차원 데이터 시각화
- 비정상 거래 후보 탐색
비지도 결과의 군집 번호 자체에는 원래 의미가 없으며, 분석자가 특성을 해석해 이름을 붙여야 한다.
6. 강화학습
에이전트가 환경과 상호작용하면서 누적 보상을 크게 하는 행동전략을 학습한다.
행동 a
Agent ─────────────► Environment
▲ │
│ 상태 s, 보상 r │
└───────────────────────┘
핵심 요소:
- 에이전트
- 환경
- 상태
- 행동
- 보상
- 정책
- 누적 보상
- 탐험과 활용
예:
- 게임 행동 선택
- 로봇 제어
- 자원 배분
- 동적 추천·광고 정책
- 네트워크·스케줄링 최적화
보상 설계가 잘못되면 모델이 원래 의도와 다른 방식으로 보상을 최대화할 수 있다.
7. 세 학습 유형 비교
| 구분 | 정답 데이터 | 목표 | 대표 결과 |
|---|---|---|---|
| 지도학습 | 있음 | 정답 예측 | 분류·회귀 |
| 비지도학습 | 없음 | 구조 발견 | 군집·차원축소 |
| 강화학습 | 즉시 정답 대신 보상 | 순차 행동 최적화 | 정책 |
실제 시스템은 여러 방식을 함께 사용할 수 있다. 예를 들어 비지도 표현학습 후 지도학습을 수행하거나, 지도학습 모델을 강화학습의 일부로 사용할 수 있다.
8. 준지도·자기지도학습
준지도학습
적은 레이블 데이터와 많은 무레이블 데이터를 함께 사용한다.
레이블 1,000건 + 무레이블 100,000건
↓
표현·의사레이블 활용
↓
분류 모델
자기지도학습
데이터 자체에서 학습 목표를 만든다.
- 문장의 일부를 가리고 맞히기
- 다음 토큰 예측
- 이미지 일부의 관계 예측
- 서로 다른 변환의 동일성 학습
대규모 언어모델의 사전학습도 자기지도학습 형태를 널리 사용한다.
9. 규칙기반과 머신러닝
| 규칙기반 | 머신러닝 |
|---|---|
| 사람이 명시적 규칙 작성 | 데이터로 규칙의 파라미터 학습 |
| 이유를 직접 추적하기 쉬움 | 복잡한 패턴 처리에 유리 |
| 규칙 수 증가 시 관리 복잡 | 데이터 품질·편향에 의존 |
| 예상 가능한 예외에 강함 | 미지 데이터 일반화가 핵심 |
규정이 명확하고 변경이 드문 영역은 규칙이 적합할 수 있고, 복잡한 패턴은 머신러닝이 유리할 수 있다. 하이브리드 구조도 가능하다.
10. AI 생명주기
문제·목표 정의
↓
데이터 수집·검토
↓
모델 개발·검증
↓
배포
↓
사용·모니터링
↓
재학습·수정·중단
개발 성능만 아니라 운영 데이터 변화, 사용자 영향, 보안, 설명, 중단 기준을 관리한다.
11. 문제 유형을 고르는 법
정답 레이블이 있는가?
├─ 예 → 출력이 범주인가?
│ ├─ 예: 분류
│ └─ 아니오: 회귀
└─ 아니오 → 순차 행동과 보상인가?
├─ 예: 강화학습
└─ 아니오: 비지도학습
12. 강화학습의 수학적 구성
마르코프 의사결정과정은 상태 S, 행동 A, 전이, 보상 R, 할인율 γ로 표현한다. 마르코프 성질은 현재 상태가 미래 예측에 필요한 정보를 충분히 담는다는 가정이다.
Q-learning의 대표 갱신식은 다음과 같다.
Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]
현재 Q가 2, 학습률 0.5, 보상 3, 할인율 0.9, 다음 상태 최대 Q가 4이면 새 값은 2+0.5×(3+3.6-2)=4.3이다.
13. 탐색·보상·정책의 함정
ε-greedy는 확률 ε로 탐색하고 나머지 확률로 현재 최선 행동을 선택한다. 탐색을 너무 빨리 줄이면 국소적으로 나쁜 정책에 고정될 수 있고, 너무 크게 유지하면 성능이 불안정하다.
보상함수가 실제 목표를 제대로 대변하지 못하면 에이전트가 점수만 높이는 reward hacking을 할 수 있다. 보상 shaping은 희소 보상을 완화하지만 최적 정책을 왜곡하지 않도록 설계해야 한다.
14. 추가 학습 유형과 적용
- 준지도학습: 적은 레이블과 많은 비레이블 데이터 사용
- 자기지도학습: 데이터 일부를 가리거나 변형해 데이터 자체에서 학습 신호 생성
- 전이학습: 사전학습 표현을 새 과제에 재사용
- 능동학습: 모델이 정보가 큰 샘플의 라벨을 요청
- 온라인학습: 데이터 도착에 따라 점진적 갱신
- Contextual bandit: 상태 문맥을 보지만 장기 상태 전이를 완전히 다루지 않는 단순화된 강화학습 문제
15. 생명주기와 운영 실패
문제정의 → 데이터·레이블 설계 → 학습 → 검증 → 배포 → 모니터링 → 재학습/중단
학습 시점과 서비스 시점의 특성 계산이 다르면 train-serve skew가 발생한다. 미래 결과로 만들어진 특성은 label leakage를 일으킨다. 데이터 분포가 변하는 covariate drift와 입력-정답 관계가 변하는 concept drift를 구분해 모니터링한다.
16. 사람과 규칙의 결합
고위험 의사결정에서는 모델 점수만으로 자동 확정하기보다, 불확실한 사례를 사람에게 보내고 승인·이의제기·감사 로그를 제공하는 구조가 필요할 수 있다. 명확한 법규·한도·금지 조건은 규칙으로 고정하고 패턴 인식은 모델에 맡기는 하이브리드 구조도 유효하다.
확인 문제
- Q=2, α=.5, r=3, γ=.9, 다음 최대 Q=4일 때 새 Q는?
- 레이블 없이 데이터 일부를 가려 예측하는 학습은?
- 장기 누적 보상을 다루는 학습 유형은?
- 학습과 서비스의 특성 계산 차이를 무엇이라 하는가?
- reward hacking의 원인은?