SW 전공

SW 전공 이론 학습

이론 목록으로 돌아가기

데이터 거버넌스와 데이터 아키텍처

데이터 소유권·표준·메타데이터·계보·품질·마스터데이터와 분석·AI 플랫폼의 데이터 아키텍처를 학습한다.

예상 읽기 9

1. 데이터 거버넌스의 목적

데이터 거버넌스는 조직의 데이터를 신뢰 가능하고 안전하며 재사용할 수 있도록 원칙, 의사결정권, 역할, 표준, 품질, 보안, 생명주기를 정하는 체계이다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
조직 목표·법·데이터 활용 요구
           ↓
   원칙·정책·의사결정권
           ↓
소유자·스튜어드·관리자 역할
           ↓
표준·메타데이터·품질·보안
           ↓
수집·저장·이용·공유·파기
           ↓
    측정·이슈·지속 개선

거버넌스는 데이터를 사용하지 못하게 막는 활동이 아니라, 누가 어떤 조건에서 신뢰할 수 있는 데이터를 사용할지 명확히 하는 활동이다.

2. 거버넌스와 데이터 관리

구분중심 질문
거버넌스누가 결정하고 책임지는가? 어떤 원칙과 기준을 따르는가?
데이터 관리기준에 따라 데이터를 어떻게 설계·저장·운영·개선하는가?

예를 들어 “고객 데이터의 정의와 품질기준은 고객업무 책임자가 승인한다”는 거버넌스 결정이고, 실제 중복 고객을 탐지·정정하는 것은 데이터 관리 활동이다.

3. 주요 역할

역할대표 책임
Data Owner업무 관점의 정의·품질·접근 정책에 최종 책임
Data Steward표준·품질·메타데이터 이슈를 일상적으로 관리
Data CustodianDB·스토리지·백업·기술 보안 운영
Data Architect데이터 모델·흐름·플랫폼 구조 설계
Data Producer데이터 생성·제공 품질 책임
Data Consumer목적에 맞게 사용하고 오류·요구를 피드백
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
업무 소유자: "고객"의 의미와 사용 정책 승인
      │
스튜어드: 용어·품질규칙·이슈 관리
      │
기술 관리자: DB·권한·백업 운영
      │
사용자: 승인된 목적과 품질정보를 보고 활용

기술 부서만 데이터 의미를 결정하면 업무 정의와 어긋날 수 있다.

4. 데이터 아키텍처

데이터 아키텍처는 조직의 데이터가 어떤 구조로 생성·저장·연계·활용·보호되는지 설계하는 청사진이다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
업무·데이터 원칙
      ↓
개념 데이터 모델
      ↓
논리 데이터 모델
      ↓
물리 DB·파일·이벤트 스키마
      ↓
수집·통합·분석 플랫폼
      ↓
API·보고서·AI·데이터 제품

범위:

  • 데이터 도메인과 소유권
  • 모델·스키마·코드
  • 원천·허브·분석 저장소
  • 배치·스트림 데이터 흐름
  • 메타데이터·계보
  • 보안·보유·파기
  • 품질·변경·버전

5. 표준 용어와 도메인

표준 용어

조직에서 같은 의미를 같은 이름과 정의로 사용하도록 한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
용어: 고객번호
정의: 고객을 내부에서 유일하게 식별하는 영구 식별자
영문명: CUSTOMER_ID
소유부서: 고객관리부
보안등급: 내부

데이터 도메인

컬럼 값의 형식과 허용 범위를 정의한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
도메인: 금액
타입: DECIMAL(15,2)
최소: 0
단위: KRW
NULL 허용: 업무별 결정

같은 의미의 금액이 시스템마다 정수·문자열·서로 다른 단위로 저장되면 통합 오류가 생긴다.

6. 코드 관리

표준 코드는 값을 일관되게 분류·교환하도록 한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
장애등급
C: Critical
H: High
M: Medium
L: Low

관리 항목:

  • 코드와 명칭
  • 정의
  • 유효 시작·종료일
  • 상위·하위 관계
  • 사용 시스템
  • 폐기·대체 코드
  • 다국어 명칭

코드값을 단순히 삭제하면 과거 데이터 해석이 어려워질 수 있어 유효기간과 이력을 관리한다.

7. 메타데이터

메타데이터는 데이터에 관한 정보이다.

유형예시
업무 메타데이터용어, 정의, 소유자, 보안등급
기술 메타데이터테이블, 컬럼, 타입, 파일·API 스키마
운영 메타데이터생성시간, 처리건수, 최신성, 실패 이력
품질 메타데이터규칙, 점수, 오류율, 이슈
사용 메타데이터조회 빈도, 보고서·모델·사용자
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
customer_age
├─ 업무 정의: 기준일 현재 만 나이
├─ 원천: CRM.birth_date
├─ 변환식: 기준일 - 생년월일
├─ 사용처: 고객분석, 추천모델
└─ 품질: NULL 0.2%, 범위 0~120

8. 데이터 카탈로그

카탈로그는 사용자가 데이터의 의미·위치·소유자·품질·사용조건을 찾도록 지원한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
사용자가 "월간 매출" 검색
   ↓
후보 데이터셋
   ├─ 정의·소유자
   ├─ 최신성
   ├─ 품질점수
   ├─ 계보
   ├─ 사용 예
   └─ 접근 신청

카탈로그에 항목이 많아도 정의와 품질이 비어 있으면 실제 발견성과 신뢰성이 낮다.

9. 데이터 계보

계보는 원천부터 변환·저장·사용처까지 데이터 흐름을 추적한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
POS.sales_amount
     ↓ 환율·세금 변환
DW.net_sales
     ↓ 월 집계
Finance.monthly_sales
     ↓
경영 보고서·예측 모델

활용:

  • 컬럼 변경 영향 분석
  • 오류 원인 추적
  • 보고서 수치의 출처 확인
  • AI 학습 데이터 추적
  • 규제·감사 증적
  • 삭제·보유 영향 판단

단순 테이블 연결뿐 아니라 변환식과 실행 이력까지 필요할 수 있다.

10. 데이터 품질 관리

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
중요 데이터요소 선정
      ↓
품질 차원·규칙 정의
      ↓
자동 측정
      ↓
이슈 우선순위·소유자 지정
      ↓
원천 수정·재처리
      ↓
재발방지·지표 확인

품질 지표 예:

  • 필수값 완전성
  • 코드 유효성
  • 중복률
  • 원천·DW 일치율
  • 데이터 최신성
  • 오류 해결시간
  • 품질규칙 적용률

모든 컬럼을 같은 수준으로 관리하기보다 의사결정·규제·AI 결과에 중요한 핵심 데이터요소를 우선한다.

11. 마스터데이터와 참조데이터

  • 마스터데이터: 고객·상품·조직·계약처럼 여러 업무에서 공유하는 핵심 개체
  • 참조데이터: 국가코드·통화코드·상태코드처럼 분류·해석 기준이 되는 값
CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
시스템 A 고객 C001 ─┐
시스템 B 고객 8891 ─┼─ 식별·정합 ─► Golden Record
시스템 C 고객 K77  ─┘

MDM은 중복 식별, 병합규칙, 기준 레코드, 배포, 변경·승인 과정을 관리한다.

12. 데이터 계약과 스키마 변경

데이터 생산자와 소비자 사이에 스키마·의미·품질·서비스 수준을 명시할 수 있다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
Data Contract
- 필드·타입·단위
- 의미와 소유자
- 갱신주기
- 품질기준
- 호환성·버전
- 보안등급
- 장애·변경 통지

필드 삭제·타입 변경은 보고서·ETL·모델을 깨뜨릴 수 있으므로 버전과 하위호환을 관리한다.

13. 데이터 제품과 Data Mesh 개념

Data Mesh는 도메인 조직이 데이터를 제품처럼 책임지고, 공통 셀프서비스 플랫폼과 연합 거버넌스로 운영하려는 접근이다.

핵심 아이디어:

  • 도메인 중심 소유권
  • 데이터 제품
  • 셀프서비스 데이터 플랫폼
  • 연합형 거버넌스

모든 조직에 적합한 단일 정답은 아니다. 도메인 역량·중복·상호운용·표준 통제 비용을 고려해야 한다.

14. AI와 데이터 거버넌스

AI에서는 다음 연결이 중요하다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
학습 데이터
   ├─ 출처·동의·사용근거
   ├─ 버전·계보
   ├─ 품질·대표성
   ├─ 민감정보
   └─ 편향
        ↓
모델·평가·배포
        ↓
운영 피드백 데이터

데이터셋 버전과 모델 버전을 연결해야 재현성과 오류 원인 분석이 가능하다.

15. 보안·생명주기

  • 데이터 분류와 보안등급
  • 최소권한
  • 암호화·마스킹
  • 개발·분석 환경 비식별화
  • 외부 제공·위탁
  • 보유·아카이브·파기
  • 대량 반출 감시
  • 백업·복구
  • 삭제 요구가 계보·복제·모델에 미치는 영향

16. 역할·메타데이터·계보의 연결

  • Data Owner: 데이터 사용 목적·정책·품질 목표에 대한 업무 책임
  • Data Steward: 정의·규칙·품질 이슈를 운영하고 조정
  • Custodian/Engineer: 저장·백업·접근통제·파이프라인 등 기술 운영

업무 메타데이터는 용어·정의·소유자, 기술 메타데이터는 스키마·타입·경로, 운영 메타데이터는 실행시간·성공여부·사용량을 포함한다. 카탈로그는 이 메타데이터를 검색·탐색·권한 요청과 연결한다.

계보는 단순 화살표가 아니라 컬럼 수준 변환과 실행 버전까지 추적할수록 변경 영향 분석에 유리하다.

17. 품질점수와 이슈 처리

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
품질점수 = Σ(차원별 점수 × 가중치)

완전성 98(0.4), 유효성 90(0.3), 적시성 95(0.3)이면 94.7점이다. 지표가 임계치 미만이면 owner·steward에게 이슈를 할당하고 원인·보정·재발방지·예외 승인·종료 증적을 남긴다.

18. MDM과 SCD

Master data는 고객·상품·조직 같은 핵심 엔터티를 일관되게 식별하고 golden record를 만든다. Survivorship 규칙은 최신값, 신뢰 원천, 필드별 우선순위 등을 사용할 수 있으며 규칙 충돌 시 설명 가능한 우선순위가 필요하다.

SCD Type 2는 변경 전 행을 종료일·현재여부로 남기고 새 버전을 추가해 이력을 보존한다. 현재값만 덮어쓰는 Type 1과 구분한다.

19. 데이터 계약과 호환성

Backward compatibility는 새 producer가 만든 데이터를 기존 consumer가 계속 읽을 수 있는 성질로 설명할 수 있다. 기존 필수 컬럼 삭제·의미 변경·타입 축소는 위험하다. 선택 컬럼 추가와 합리적 기본값은 상대적으로 안전할 수 있지만 소비자 구현을 확인해야 한다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
제안 → 자동 호환성 검사 → 소비자 영향 조회 → 승인·통지 → 병행 기간 → 폐기

20. Data Mesh와 AI 거버넌스

Data Mesh는 도메인 데이터 소유, 데이터 제품, self-serve 플랫폼, 연합 거버넌스를 강조한다. 중앙 통제를 없애는 것이 아니라 공통 표준과 분산 책임을 결합한다.

AI 데이터 거버넌스에는 학습·평가 데이터의 출처, 라이선스, 동의·목적, 정제·라벨링 버전, 대표성, 품질, 모델·실험과의 연결을 포함한다. 삭제 요청이 발생하면 원천뿐 아니라 파생 데이터셋·임베딩·캐시·모델 재학습 정책까지 영향 범위를 추적한다.

확인 문제

  1. 완전성 98(.4), 유효성 90(.3), 적시성 95(.3)의 점수는?
  2. 현재값을 덮어쓰지 않고 새 버전을 추가하는 SCD는?
  3. 업무 용어·정의·소유자는 어떤 메타데이터인가?
  4. Data Mesh가 중앙 표준을 없애는가?
  5. 기존 필수 컬럼 삭제가 위험한 이유는?