현재 선택한 데이터 아키텍처 과정

DAP 이론 학습

이론 목록으로 돌아가기

업무 데이터 값 품질과 오류 원인

업무 데이터 값에 대해 NULL·형식·범위·도메인·유일성·참조·상호관계·시계열·집계 규칙을 실행하고 프로파일링으로 이상을 찾습니다. 오류를 입력·인터페이스·변환·표준·모델·운영 원인으로 추적해 값 정정과 발생 통제를 함께 개선합니다.

예상 읽기 6

핵심 요약

업무 데이터 값 품질은 실제 레코드와 필드가 업무 규칙을 만족하는지 측정하는 영역이다. 프로파일링은 분포·패턴·NULL·중복·이상값을 찾아 결함 후보를 제시하고, 품질 규칙은 업무상 맞고 틀림을 판정한다. 오류 값을 고치는 것과 오류가 다시 생기지 않게 원인을 제거하는 것은 별도 활동이다.

CODE코드 영역 안에서 좌우로 이동할 수 있습니다.
프로파일링 → 품질 규칙 실행 → 결함 확인 → 영향·원인 분석
    → 값 정정/격리 + 입력·연계·모델·표준 통제 개선 → 재검증

학습 목표

  • 단일 열·다중 열·참조·시계열·집계 품질 규칙을 구분합니다.
  • 프로파일링 통계와 업무 규칙의 역할 차이를 설명합니다.
  • 오류 원인을 입력, 인터페이스, 변환, 표준, 모델, 운영 계층으로 분류합니다.
  • 결함 등록부터 개선·검증·재발 방지까지 적용합니다.

1. 개념 설명

1.1 값 품질 규칙 유형

유형규칙 예시주된 차원
NULL/필수활성 고객의 고객명은 NULL 불가완전성
형식·자료형이메일 패턴, 날짜 형식, 숫자 길이유효성
범위·도메인할인율 0~100, 상태코드 허용 집합유효성
유일성주문번호 업무키 중복 금지유일성
참조 무결성주문.고객ID는 고객에 존재일관성·유효성
열 간 관계종료일≥시작일, 합계=공급가+세액일관성
시계열·상태 전이취소 후 배송완료로 바로 변경 불가일관성·정확성
시스템 간 대사원장 잔액=DW 집계 잔액일관성·완전성
정확성 대조주소가 공식 주소 기준과 일치정확성
적시성거래 후 10분 안에 DW 반영적시성

규칙에는 적용 조건이 중요하다. 예를 들어 해지일은 모든 고객에게 필수값이 아니라 해지 상태인 고객에게만 필수일 수 있다.

1.2 데이터 프로파일링

프로파일링은 데이터의 실제 상태를 통계적으로 탐색한다.

  • 행 수·NULL 수·NULL 비율
  • distinct 수와 중복 업무키
  • 최소·최대·평균·분위수
  • 길이·패턴·문자 집합·빈도 분포
  • 상·하위 빈도값, 희귀값, 이상값
  • 열 간 함수적 종속 후보와 상관
  • 참조 미존재 건수와 고아 레코드
  • 일자별 유입량·지연·급증·급감

최댓값이 9999라는 발견은 곧 오류라는 뜻이 아니다. 업무 의미와 규칙을 확인해야 하며, 반대로 흔한 값이라도 잘못된 기본값이 대량 반복된 것일 수 있다.

1.3 오류 원인 계층

계층원인 예시재발 방지 통제
입력·수집필수 검증 누락, 사용자 오입력, 센서 오류화면·API 검증, 선택 목록, 이중 확인
인터페이스필드 매핑 오류, 코드 변환 누락, 메시지 손실계약 스키마, 대사, 재처리·멱등성
변환·배치잘못된 조인, 반올림·시간대·집계 오류단위 테스트, 건수·금액 대사, 버전 관리
표준용어·도메인·코드 정의 충돌표준 정비, 매핑·버전·변경 통지
모델·DBNULL/키/관계 제약 누락, 중복 저장모델·제약 개선, 단일 원천 정의
운영수동 수정, 배포 누락, 작업 순서 오류승인·감사, 자동화, 모니터링·런북
외부 원천공급자 지연·결함, 기준 데이터 변경SLA, 수신 품질 게이트, 원천 피드백

1.4 결함 생명주기

결함 레코드는 최소한 다음을 포함한다.

  • 대상 데이터·규칙·발견 시각·기준일
  • 오류 건수·비율·샘플과 영향 업무
  • 원인 분류·근거·관련 변경
  • 소유자·우선순위·목표일
  • 정정 방식·원천 수정·재처리 범위
  • 검증 결과·재발 여부·종료 승인

값을 직접 수정할 때는 원천 시스템과 하류 시스템 중 어디가 기준인지, 수정이 다시 덮어써지지 않는지, 과거 집계·보고서를 재처리해야 하는지 확인한다.

2. 구성요소와 관계

발견 결과즉시 결론 금지추가 확인
NULL 20%모두 결함조건부 필수 여부, 미적용 대상
코드 Z 1건무조건 삭제신규 코드·변경 통지·오입력 여부
고객 중복 100건PK 위반업무키·동일인 판정 규칙
합계 불일치DW 오류원천 정정·지연·환율·반올림·취소 시점
극단값센서 오류실제 희귀 사건·단위·수집 범위

3. 진단·개선 흐름

  1. 중요 데이터와 업무 조건을 정하고 프로파일링한다.
  2. 통계 이상을 바탕으로 업무 담당자와 실행 가능한 품질 규칙을 정의한다.
  3. 기준일과 분모를 고정해 규칙을 실행하고 오류 샘플을 검증한다.
  4. 업무·규제·고객 영향으로 우선순위를 정한다.
  5. 원천부터 하류까지 계보를 따라 최초 발생 지점을 찾는다.
  6. 원천 값 정정·재처리와 생성 통제 개선을 함께 수행한다.
  7. 개선 전후 오류율·재발률·업무 결과를 비교한다.

4. 사례와 적용

사례: 주문합계와 상세합계 불일치

주문.총금액SUM(주문상세.금액)이 3,000건에서 다르다.

가능한 원인은 단순 오입력만이 아니다.

  • 취소 상세를 집계에서 제외하는 조건 차이
  • 세금·할인·배송비의 정의 차이
  • 주문 헤더와 상세의 반영 시차
  • 배치 실패 후 일부만 재처리
  • 통화·반올림 규칙 차이
  • 중복 상세 또는 고아 상세

먼저 업무상 합계 정의와 기준시점을 확정하고 원인별로 오류를 분류한다. 헤더 값을 상세합계로 일괄 덮으면 정당한 조정금액이나 지연 상태를 훼손할 수 있다.

5. 비교와 구분

구분프로파일링품질 규칙데이터 클렌징
목적분포·패턴·이상 탐색업무 기준으로 적합/부적합 판정오류 값을 정정·표준화·통합
결과후보·통계결함 건수·준수율변경된 데이터와 이력
한계업무 의미 없이 오류 확정 어려움잘못 정의하면 정상값을 오류 처리원인 통제가 없으면 재발

시험 판단 포인트

  • 프로파일링 결과는 결함 후보이며 업무 규칙과 기준 데이터로 확인해야 한다.
  • 정확성은 신뢰 가능한 기준과 대조가 필요해 단순 형식 검사보다 비용이 클 수 있다.
  • 열 간·시스템 간·시계열 규칙은 단일 컬럼 유효성으로 찾을 수 없는 결함을 탐지한다.
  • 결함 개선은 원천 정정, 하류 재처리, 생성 통제와 재검증을 포함한다.
  • 오류 원인과 오류가 발견된 위치는 다를 수 있다. DW에서 발견된 오류가 원천 입력에서 시작될 수 있다.

자주 틀리는 부분

  • NULL 비율이 높다는 이유만으로 조건부 선택 항목도 오류로 본다.
  • PK가 다르면 고객 중복이 아니라고 판단한다.
  • 프로파일링 도구가 제시한 이상값을 업무 확인 없이 삭제한다.
  • 하류 데이터만 수정하고 다음 적재 때 원천 오류가 다시 덮어쓰게 둔다.
  • 오류율만 낮추고 정정으로 인해 보고서·정산 결과가 바뀌는 영향은 검증하지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01[객관식] 프로파일링과 품질 규칙의 관계로 옳은 것은? ① 프로파일링 통계는 항상 오류를 확정한다. ② 품질 규칙은 업무 조건을 포함해 적합 여부를 판정한다. ③ 클렌징은 오류 원인을 자동 제거한다. ④ distinct 수는 어떤 업무에서도 불필요하다.
정답 및 해설

정답: ②

  • ① 통계 이상은 업무상 정상일 수 있어 후보에 가깝다.
  • ② 품질 규칙은 적용 조건과 업무 기준으로 판정한다.
  • ③ 클렌징은 값 정정이며 입력·변환 원인을 별도 개선해야 한다.
  • ④ distinct 수는 유일성·코드 분포·식별자 분석에 유용하다.
02[객관식] 종료일 < 시작일을 탐지하는 규칙의 유형은? ① 단일 열 형식 ② 열 간 관계 ③ 유일성만 ④ 백업 무결성
정답 및 해설

정답: ②

  • 시작일과 종료일 두 열의 상호관계를 검사한다.
  • 각 날짜가 형식상 유효해도 순서가 모순될 수 있다.
03[연결형] 매핑 오류, FK 누락, 수동 수정, 외부 지연을 인터페이스·모델/DB·운영·외부 원천과 연결하세요.
정답 및 해설

정답: 매핑 오류→인터페이스, FK 누락→모델/DB, 수동 수정→운영, 외부 지연→외부 원천.

04[계산형] 검사 대상 주문 50,000건 중 총액-상세합계 규칙을 만족한 주문이 49,500건이다. 일관성 준수율과 오류율을 계산하세요.
정답 및 해설

정답:

  • 일관성 준수율 = 49,500 / 50,000 × 100 = 99%.
  • 오류율 = 500 / 50,000 × 100 = 1%.
05[사례 판단] DW 고객 주소 5,000건이 잘못되었고 원천 CRM에도 같은 오류가 있다. 수정·재처리·재발 방지 순서를 설명하세요.
정답 및 해설

모범 답안:

  • CRM이 기준 원천인지 확인하고 오류 원인·정정 근거를 승인한다.
  • 원천 CRM을 먼저 정정하고 입력 검증·주소 기준 연계 등 발생 통제를 개선한다.
  • 변경분 또는 영향 범위를 DW에 재적재하고 주소를 사용하는 보고서·모델·하류 시스템을 재처리한다.
  • 원천·DW의 오류율, 건수 대사와 재발 여부를 검증한다. DW만 직접 수정하면 다음 적재에서 오류가 재발할 수 있다.