현재 선택한 데이터 아키텍처 과정

DAsP 이론 학습

이론 목록으로 돌아가기

데이터 표준화의 필요성과 원칙

데이터 표준화는 명칭만 통일하는 작업이 아니라 같은 업무 개념의 의미, 값의 표현, 코드와 메타데이터를 일관되게 관리하는 활동이다. 이 단원은 표준 구성요소의 상세 정의보다 표준화가 필요한 원인·효과·원칙과 적용 범위를 다룬다.

예상 읽기 5

핵심 요약

데이터 표준화는 서로 다른 시스템에서 같은 데이터를 같은 뜻과 규칙으로 이해하도록 만드는 활동이다. 이름만 같게 바꾸는 것이 아니라 업무 의미, 데이터 형식, 허용값, 코드 의미, 메타데이터와 적용 이력을 함께 통제해야 공유·연계·품질 개선 효과가 발생한다.

학습 목표

  • 비표준 데이터가 통합, 분석, 개발 및 운영에 만드는 문제를 설명한다.
  • 표준화와 데이터 정규화·데이터 품질관리의 목적을 구분한다.
  • 표준화 원칙을 전사 공통 기준과 업무별 예외에 적용한다.
  • 표준 수립부터 적용·변경관리까지의 전체 흐름을 판단한다.

1. 개념 설명

1.1 데이터 표준화의 대상

표준화 대상은 단순한 컬럼명이 아니다. 일반적으로 표준 단어·용어·도메인·코드와 이들을 설명하고 연결하는 메타데이터를 포함한다. 예를 들어 고객번호라는 이름을 통일해도 한 시스템은 개인만, 다른 시스템은 법인까지 포함한다면 의미 표준화가 끝난 것이 아니다.

1.2 표준화가 필요한 대표 원인

  • 동의어: 고객번호, 회원번호, CUST_ID가 같은 대상을 가리킨다.
  • 동음이의어: 상태가 주문상태와 회원상태에서 서로 다른 뜻으로 사용된다.
  • 표현 불일치: 날짜가 YYYYMMDD, YYYY-MM-DD, 문자열과 날짜형으로 혼재한다.
  • 값 규칙 불일치: 성별을 M/F, 1/2, 남/여로 저장한다.
  • 범위 불일치: 매출액의 부가세·환불 포함 여부와 기준 시점이 시스템마다 다르다.

이러한 불일치는 인터페이스마다 변환 로직을 만들게 하고, 같은 지표가 서로 다른 값으로 계산되는 원인이 된다.

1.3 표준화 원칙

시험에서는 특정 원칙 명칭의 암기보다 다음 판단 기준을 적용할 수 있어야 한다.

판단 기준확인 질문실패 징후
명확성정의만 읽고 대상·범위·시점을 구분할 수 있는가용어를 그대로 반복한 순환 정의
일관성같은 의미에 같은 명칭·도메인·코드를 적용하는가부서별 동의어와 임의 약어 유지
유일성하나의 표준이 다른 표준과 의미상 중복되지 않는가이름만 다른 중복 표준 등록
재사용성여러 모델과 시스템이 같은 기준을 재사용할 수 있는가시스템마다 전용 도메인을 과도하게 생성
확장성새 업무와 값이 생겨도 의미를 훼손하지 않고 확장 가능한가코드 의미 변경으로 과거 데이터가 왜곡
추적성표준의 근거·버전·사용처·변경 이력을 찾을 수 있는가변경 후 영향 대상과 전환 여부를 알 수 없음

1.4 공통 기준과 예외

전사 공통 표준이 우선이지만 업무 특수성이 실제로 존재할 수 있다. 예외는 표준을 무시하는 자유가 아니라 사유, 범위, 위험, 승인자, 만료일과 대체 계획을 갖춘 통제 대상이다. 단순한 사용자 익숙함이나 개발 편의만으로 영구 예외를 허용하면 표준화 효과가 사라진다.

2. 표준화의 효과와 한계

관점기대 효과표준만으로 해결되지 않는 것
업무용어 의미와 지표 기준의 공통 이해잘못된 업무 규칙 자체의 자동 교정
데이터 연계변환·매핑 감소, 상호운용성 향상원천 데이터 누락과 중복의 자동 제거
개발·운영재사용 가능한 도메인·코드·명명 기준성능 설계와 장애 대응
품질형식·코드·정의 불일치 예방모든 값 오류에 대한 완전한 진단
거버넌스책임·승인·변경 이력의 가시성현업 합의 없이 도구만 설치한 상태

3. 표준화 판단 흐름

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
비표준 현황과 영향 파악
        ↓
적용 범위·우선순위·책임 정의
        ↓
표준화 원칙과 표준 구성요소 수립
        ↓
검토·승인·공표 및 모델·DB 적용
        ↓
준수 점검·예외 통제·변경관리

현행 시스템 전체를 즉시 개명하기 어려운 경우에도 신규·변경 개발부터 표준을 적용하고, 기존 항목은 표준과의 매핑 및 전환 우선순위를 관리해야 한다.

4. 사례

고객 통합 프로젝트에서 세 시스템이 회원번호, 고객ID, 거래처번호를 사용한다. 이름만 비교해서 하나로 바꾸면 개인회원, 비회원 구매자, 법인 거래처의 범위 차이를 놓칠 수 있다. 먼저 각 식별자의 대상·발급 시점·유일성·폐기 규칙을 비교하고, 공통 개념과 업무별 하위 개념을 구분한 뒤 표준 용어·도메인·매핑을 결정해야 한다.

5. 비교와 구분

구분핵심 목적대표 산출물
데이터 표준화의미·명칭·형식·코드의 공통 기준 수립과 적용표준 단어·용어·도메인·코드 정의서
데이터 정규화함수 종속과 이상 현상을 줄이도록 관계 구조 정리정규화된 논리 데이터 모델
데이터 품질관리품질 목표를 정하고 값·구조·프로세스의 결함을 진단·개선품질 규칙, 진단 결과, 개선 이력

시험 판단 포인트

  • 컬럼명 통일만으로 의미·도메인·코드까지 표준화되었다고 볼 수 없다.
  • 표준화는 일회성 사전 작성이 아니라 적용, 준수 점검과 변경관리를 포함한다.
  • 전사 표준과 업무 예외는 양자택일이 아니다. 공통 기준을 우선하고 예외를 통제한다.
  • 표준화는 데이터 품질을 예방적으로 지원하지만 모든 값 오류를 자동으로 해결하지 않는다.

자주 틀리는 부분

  • 현재 데이터 타입이 같다는 이유로 업무 의미도 같다고 판단한다.
  • 모든 현행 명칭을 그대로 표준으로 등록해 동의어를 보존한다.
  • 표준 등록 건수가 많을수록 성숙도가 높다고 본다.
  • 승인된 예외에 만료일과 후속 조치가 없어도 정상 준수로 간주한다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01[객관식] 데이터 표준화의 설명으로 가장 적절한 것은? - A. 모든 테이블을 제3정규형으로 변환하는 활동 - B. 같은 업무 개념의 의미·명칭·형식·코드를 일관되게 정의하고 적용하는 활동 - C. 운영 데이터의 오류 값을 일괄 수정하는 활동 - D. DBMS별 물리 데이터 타입을 하나로 통일하는 활동
정답 및 해설

정답: B

  • B는 표준화의 핵심인 의미·명칭·형식·코드의 공통 기준과 적용을 모두 포함한다.
  • A는 정규화, C는 데이터 정비 또는 품질 개선, D는 제품 종속적인 물리 타입 통일에 가깝다.
02[객관식] 표준화 원칙에 가장 부합하는 조치는? - A. 부서가 익숙한 동의어를 모두 별도 표준으로 승인한다. - B. 긴급 예외는 승인 기록 없이 영구 사용하도록 한다. - C. 표준의 정의, 사용처, 버전과 변경 근거를 추적 가능하게 관리한다. - D. 표준 수를 늘리기 위해 시스템별 전용 도메인을 생성한다.
정답 및 해설

정답: C

  • C는 추적성과 변경 통제를 확보하는 조치다.
  • A는 유일성과 일관성을 훼손하고, B는 예외 통제를 무력화하며, D는 재사용성을 떨어뜨린다.
03[참·거짓] 데이터 표준을 수립하면 원천 데이터의 누락·중복·오입력도 별도의 품질 활동 없이 모두 해결된다.
정답 및 해설

정답: 거짓

  • 표준화는 불일치를 예방하고 진단 기준을 제공하지만, 이미 발생한 누락·중복·오입력은 별도의 품질 진단과 정비가 필요하다.
04[사례 판단] 고객번호와 회원번호를 통합하려 한다. 명칭을 결정하기 전에 최소 네 가지 확인 항목을 제시하라.
정답 및 해설

모범 답안

  • 두 식별자가 가리키는 대상 범위, 발급·생성 시점, 유일성 범위, 값의 변경·폐기 규칙을 확인한다.
  • 추가로 개인·법인·비회원 포함 여부, 도메인과 길이, 기존 사용처, 전환·매핑 영향을 확인할 수 있다.
  • 이름이 비슷하다는 사실만으로 같은 표준을 선택하면 범위가 다른 개념을 잘못 통합할 수 있다.