SW 전공

SW 전공 이론 학습

이론 목록으로 돌아가기

지도학습·비지도학습·강화학습

AI·머신러닝·딥러닝의 관계와 지도·비지도·강화학습의 데이터·목표·대표 문제를 구분한다.

예상 읽기 7

1. AI·머신러닝·딥러닝의 관계

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
인공지능(AI)
├─ 규칙·탐색·지식표현
└─ 머신러닝(ML)
   ├─ 전통적 통계·트리·거리 기반 모델
   └─ 딥러닝(DL)
      └─ 여러 층의 신경망
  • AI: 지능적 행동을 수행하도록 만드는 넓은 분야
  • 머신러닝: 데이터에서 패턴을 학습하여 예측·판단 규칙을 만드는 방법
  • 딥러닝: 다층 신경망을 이용하는 머신러닝 방법

모든 AI가 머신러닝인 것은 아니고, 모든 머신러닝이 딥러닝인 것도 아니다.

2. 학습과 추론

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
학습 단계
데이터 + 목표 + 알고리즘
          ↓
       모델 파라미터

추론 단계
새 입력 + 학습된 모델
          ↓
      예측·분류·생성

학습은 모델의 파라미터를 찾는 과정이고, 추론은 학습된 모델을 새 데이터에 적용하는 과정이다.

3. 특성과 레이블

  • 특성(Feature): 예측에 사용하는 입력 변수
  • 레이블(Label·Target): 맞히려는 정답
  • 샘플: 한 관측 단위
  • 모델: 입력에서 출력으로 가는 규칙
  • 파라미터: 학습으로 결정되는 내부 값
  • 하이퍼파라미터: 학습 전에 정하거나 검증으로 선택하는 설정
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
대출 심사 샘플
특성: 소득, 부채, 연체횟수, 근속기간
레이블: 상환 / 부도

4. 지도학습

입력과 정답 레이블이 함께 있는 데이터로 학습한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
(특성 X, 정답 y) 여러 건
         ↓
      모델 학습
         ↓
새 X에 대한 y 예측

대표 문제:

  • 분류: 범주 예측
  • 회귀: 연속 수치 예측
  • 순위·확률 예측

예:

  • 스팸 여부
  • 장애 발생 여부
  • 주택가격
  • 처리시간
  • 고객 이탈 확률

지도학습의 성능은 레이블 품질과 실제 운영 데이터와의 일치에 크게 영향을 받는다.

5. 비지도학습

정답 레이블 없이 데이터의 구조와 패턴을 찾는다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
특성 X만 존재
    ↓
유사성·분포·구조 탐색
    ↓
군집·차원축소·이상패턴

대표 문제:

  • 군집화
  • 차원축소
  • 연관·패턴 탐색
  • 이상치 탐지
  • 표현 학습

예:

  • 유사 고객군 분류
  • 시스템 로그 패턴 탐색
  • 고차원 데이터 시각화
  • 비정상 거래 후보 탐색

비지도 결과의 군집 번호 자체에는 원래 의미가 없으며, 분석자가 특성을 해석해 이름을 붙여야 한다.

6. 강화학습

에이전트가 환경과 상호작용하면서 누적 보상을 크게 하는 행동전략을 학습한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
            행동 a
Agent ─────────────► Environment
  ▲                       │
  │ 상태 s, 보상 r        │
  └───────────────────────┘

핵심 요소:

  • 에이전트
  • 환경
  • 상태
  • 행동
  • 보상
  • 정책
  • 누적 보상
  • 탐험과 활용

예:

  • 게임 행동 선택
  • 로봇 제어
  • 자원 배분
  • 동적 추천·광고 정책
  • 네트워크·스케줄링 최적화

보상 설계가 잘못되면 모델이 원래 의도와 다른 방식으로 보상을 최대화할 수 있다.

7. 세 학습 유형 비교

구분정답 데이터목표대표 결과
지도학습있음정답 예측분류·회귀
비지도학습없음구조 발견군집·차원축소
강화학습즉시 정답 대신 보상순차 행동 최적화정책

실제 시스템은 여러 방식을 함께 사용할 수 있다. 예를 들어 비지도 표현학습 후 지도학습을 수행하거나, 지도학습 모델을 강화학습의 일부로 사용할 수 있다.

8. 준지도·자기지도학습

준지도학습

적은 레이블 데이터와 많은 무레이블 데이터를 함께 사용한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
레이블 1,000건 + 무레이블 100,000건
            ↓
     표현·의사레이블 활용
            ↓
        분류 모델

자기지도학습

데이터 자체에서 학습 목표를 만든다.

  • 문장의 일부를 가리고 맞히기
  • 다음 토큰 예측
  • 이미지 일부의 관계 예측
  • 서로 다른 변환의 동일성 학습

대규모 언어모델의 사전학습도 자기지도학습 형태를 널리 사용한다.

9. 규칙기반과 머신러닝

규칙기반머신러닝
사람이 명시적 규칙 작성데이터로 규칙의 파라미터 학습
이유를 직접 추적하기 쉬움복잡한 패턴 처리에 유리
규칙 수 증가 시 관리 복잡데이터 품질·편향에 의존
예상 가능한 예외에 강함미지 데이터 일반화가 핵심

규정이 명확하고 변경이 드문 영역은 규칙이 적합할 수 있고, 복잡한 패턴은 머신러닝이 유리할 수 있다. 하이브리드 구조도 가능하다.

10. AI 생명주기

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
문제·목표 정의
   ↓
데이터 수집·검토
   ↓
모델 개발·검증
   ↓
배포
   ↓
사용·모니터링
   ↓
재학습·수정·중단

개발 성능만 아니라 운영 데이터 변화, 사용자 영향, 보안, 설명, 중단 기준을 관리한다.

11. 문제 유형을 고르는 법

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
정답 레이블이 있는가?
   ├─ 예 → 출력이 범주인가?
   │        ├─ 예: 분류
   │        └─ 아니오: 회귀
   └─ 아니오 → 순차 행동과 보상인가?
            ├─ 예: 강화학습
            └─ 아니오: 비지도학습

12. 강화학습의 수학적 구성

마르코프 의사결정과정은 상태 S, 행동 A, 전이, 보상 R, 할인율 γ로 표현한다. 마르코프 성질은 현재 상태가 미래 예측에 필요한 정보를 충분히 담는다는 가정이다.

Q-learning의 대표 갱신식은 다음과 같다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]

현재 Q가 2, 학습률 0.5, 보상 3, 할인율 0.9, 다음 상태 최대 Q가 4이면 새 값은 2+0.5×(3+3.6-2)=4.3이다.

13. 탐색·보상·정책의 함정

ε-greedy는 확률 ε로 탐색하고 나머지 확률로 현재 최선 행동을 선택한다. 탐색을 너무 빨리 줄이면 국소적으로 나쁜 정책에 고정될 수 있고, 너무 크게 유지하면 성능이 불안정하다.

보상함수가 실제 목표를 제대로 대변하지 못하면 에이전트가 점수만 높이는 reward hacking을 할 수 있다. 보상 shaping은 희소 보상을 완화하지만 최적 정책을 왜곡하지 않도록 설계해야 한다.

14. 추가 학습 유형과 적용

  • 준지도학습: 적은 레이블과 많은 비레이블 데이터 사용
  • 자기지도학습: 데이터 일부를 가리거나 변형해 데이터 자체에서 학습 신호 생성
  • 전이학습: 사전학습 표현을 새 과제에 재사용
  • 능동학습: 모델이 정보가 큰 샘플의 라벨을 요청
  • 온라인학습: 데이터 도착에 따라 점진적 갱신
  • Contextual bandit: 상태 문맥을 보지만 장기 상태 전이를 완전히 다루지 않는 단순화된 강화학습 문제

15. 생명주기와 운영 실패

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
문제정의 → 데이터·레이블 설계 → 학습 → 검증 → 배포 → 모니터링 → 재학습/중단

학습 시점과 서비스 시점의 특성 계산이 다르면 train-serve skew가 발생한다. 미래 결과로 만들어진 특성은 label leakage를 일으킨다. 데이터 분포가 변하는 covariate drift와 입력-정답 관계가 변하는 concept drift를 구분해 모니터링한다.

16. 사람과 규칙의 결합

고위험 의사결정에서는 모델 점수만으로 자동 확정하기보다, 불확실한 사례를 사람에게 보내고 승인·이의제기·감사 로그를 제공하는 구조가 필요할 수 있다. 명확한 법규·한도·금지 조건은 규칙으로 고정하고 패턴 인식은 모델에 맡기는 하이브리드 구조도 유효하다.

확인 문제

  1. Q=2, α=.5, r=3, γ=.9, 다음 최대 Q=4일 때 새 Q는?
  2. 레이블 없이 데이터 일부를 가려 예측하는 학습은?
  3. 장기 누적 보상을 다루는 학습 유형은?
  4. 학습과 서비스의 특성 계산 차이를 무엇이라 하는가?
  5. reward hacking의 원인은?