업무 데이터 값 품질과 오류 원인
업무 데이터 값에 대해 NULL·형식·범위·도메인·유일성·참조·상호관계·시계열·집계 규칙을 실행하고 프로파일링으로 이상을 찾습니다. 오류를 입력·인터페이스·변환·표준·모델·운영 원인으로 추적해 값 정정과 발생 통제를 함께 개선합니다.
핵심 요약
업무 데이터 값 품질은 실제 레코드와 필드가 업무 규칙을 만족하는지 측정하는 영역이다. 프로파일링은 분포·패턴·NULL·중복·이상값을 찾아 결함 후보를 제시하고, 품질 규칙은 업무상 맞고 틀림을 판정한다. 오류 값을 고치는 것과 오류가 다시 생기지 않게 원인을 제거하는 것은 별도 활동이다.
프로파일링 → 품질 규칙 실행 → 결함 확인 → 영향·원인 분석
→ 값 정정/격리 + 입력·연계·모델·표준 통제 개선 → 재검증
학습 목표
- 단일 열·다중 열·참조·시계열·집계 품질 규칙을 구분합니다.
- 프로파일링 통계와 업무 규칙의 역할 차이를 설명합니다.
- 오류 원인을 입력, 인터페이스, 변환, 표준, 모델, 운영 계층으로 분류합니다.
- 결함 등록부터 개선·검증·재발 방지까지 적용합니다.
1. 개념 설명
1.1 값 품질 규칙 유형
| 유형 | 규칙 예시 | 주된 차원 |
|---|---|---|
| NULL/필수 | 활성 고객의 고객명은 NULL 불가 | 완전성 |
| 형식·자료형 | 이메일 패턴, 날짜 형식, 숫자 길이 | 유효성 |
| 범위·도메인 | 할인율 0~100, 상태코드 허용 집합 | 유효성 |
| 유일성 | 주문번호 업무키 중복 금지 | 유일성 |
| 참조 무결성 | 주문.고객ID는 고객에 존재 | 일관성·유효성 |
| 열 간 관계 | 종료일≥시작일, 합계=공급가+세액 | 일관성 |
| 시계열·상태 전이 | 취소 후 배송완료로 바로 변경 불가 | 일관성·정확성 |
| 시스템 간 대사 | 원장 잔액=DW 집계 잔액 | 일관성·완전성 |
| 정확성 대조 | 주소가 공식 주소 기준과 일치 | 정확성 |
| 적시성 | 거래 후 10분 안에 DW 반영 | 적시성 |
규칙에는 적용 조건이 중요하다. 예를 들어 해지일은 모든 고객에게 필수값이 아니라 해지 상태인 고객에게만 필수일 수 있다.
1.2 데이터 프로파일링
프로파일링은 데이터의 실제 상태를 통계적으로 탐색한다.
- 행 수·NULL 수·NULL 비율
- distinct 수와 중복 업무키
- 최소·최대·평균·분위수
- 길이·패턴·문자 집합·빈도 분포
- 상·하위 빈도값, 희귀값, 이상값
- 열 간 함수적 종속 후보와 상관
- 참조 미존재 건수와 고아 레코드
- 일자별 유입량·지연·급증·급감
최댓값이 9999라는 발견은 곧 오류라는 뜻이 아니다. 업무 의미와 규칙을 확인해야 하며, 반대로 흔한 값이라도 잘못된 기본값이 대량 반복된 것일 수 있다.
1.3 오류 원인 계층
| 계층 | 원인 예시 | 재발 방지 통제 |
|---|---|---|
| 입력·수집 | 필수 검증 누락, 사용자 오입력, 센서 오류 | 화면·API 검증, 선택 목록, 이중 확인 |
| 인터페이스 | 필드 매핑 오류, 코드 변환 누락, 메시지 손실 | 계약 스키마, 대사, 재처리·멱등성 |
| 변환·배치 | 잘못된 조인, 반올림·시간대·집계 오류 | 단위 테스트, 건수·금액 대사, 버전 관리 |
| 표준 | 용어·도메인·코드 정의 충돌 | 표준 정비, 매핑·버전·변경 통지 |
| 모델·DB | NULL/키/관계 제약 누락, 중복 저장 | 모델·제약 개선, 단일 원천 정의 |
| 운영 | 수동 수정, 배포 누락, 작업 순서 오류 | 승인·감사, 자동화, 모니터링·런북 |
| 외부 원천 | 공급자 지연·결함, 기준 데이터 변경 | SLA, 수신 품질 게이트, 원천 피드백 |
1.4 결함 생명주기
결함 레코드는 최소한 다음을 포함한다.
- 대상 데이터·규칙·발견 시각·기준일
- 오류 건수·비율·샘플과 영향 업무
- 원인 분류·근거·관련 변경
- 소유자·우선순위·목표일
- 정정 방식·원천 수정·재처리 범위
- 검증 결과·재발 여부·종료 승인
값을 직접 수정할 때는 원천 시스템과 하류 시스템 중 어디가 기준인지, 수정이 다시 덮어써지지 않는지, 과거 집계·보고서를 재처리해야 하는지 확인한다.
2. 구성요소와 관계
| 발견 결과 | 즉시 결론 금지 | 추가 확인 |
|---|---|---|
| NULL 20% | 모두 결함 | 조건부 필수 여부, 미적용 대상 |
코드 Z 1건 | 무조건 삭제 | 신규 코드·변경 통지·오입력 여부 |
| 고객 중복 100건 | PK 위반 | 업무키·동일인 판정 규칙 |
| 합계 불일치 | DW 오류 | 원천 정정·지연·환율·반올림·취소 시점 |
| 극단값 | 센서 오류 | 실제 희귀 사건·단위·수집 범위 |
3. 진단·개선 흐름
- 중요 데이터와 업무 조건을 정하고 프로파일링한다.
- 통계 이상을 바탕으로 업무 담당자와 실행 가능한 품질 규칙을 정의한다.
- 기준일과 분모를 고정해 규칙을 실행하고 오류 샘플을 검증한다.
- 업무·규제·고객 영향으로 우선순위를 정한다.
- 원천부터 하류까지 계보를 따라 최초 발생 지점을 찾는다.
- 원천 값 정정·재처리와 생성 통제 개선을 함께 수행한다.
- 개선 전후 오류율·재발률·업무 결과를 비교한다.
4. 사례와 적용
사례: 주문합계와 상세합계 불일치
주문.총금액과 SUM(주문상세.금액)이 3,000건에서 다르다.
가능한 원인은 단순 오입력만이 아니다.
- 취소 상세를 집계에서 제외하는 조건 차이
- 세금·할인·배송비의 정의 차이
- 주문 헤더와 상세의 반영 시차
- 배치 실패 후 일부만 재처리
- 통화·반올림 규칙 차이
- 중복 상세 또는 고아 상세
먼저 업무상 합계 정의와 기준시점을 확정하고 원인별로 오류를 분류한다. 헤더 값을 상세합계로 일괄 덮으면 정당한 조정금액이나 지연 상태를 훼손할 수 있다.
5. 비교와 구분
| 구분 | 프로파일링 | 품질 규칙 | 데이터 클렌징 |
|---|---|---|---|
| 목적 | 분포·패턴·이상 탐색 | 업무 기준으로 적합/부적합 판정 | 오류 값을 정정·표준화·통합 |
| 결과 | 후보·통계 | 결함 건수·준수율 | 변경된 데이터와 이력 |
| 한계 | 업무 의미 없이 오류 확정 어려움 | 잘못 정의하면 정상값을 오류 처리 | 원인 통제가 없으면 재발 |
시험 판단 포인트
- 프로파일링 결과는 결함 후보이며 업무 규칙과 기준 데이터로 확인해야 한다.
- 정확성은 신뢰 가능한 기준과 대조가 필요해 단순 형식 검사보다 비용이 클 수 있다.
- 열 간·시스템 간·시계열 규칙은 단일 컬럼 유효성으로 찾을 수 없는 결함을 탐지한다.
- 결함 개선은 원천 정정, 하류 재처리, 생성 통제와 재검증을 포함한다.
- 오류 원인과 오류가 발견된 위치는 다를 수 있다. DW에서 발견된 오류가 원천 입력에서 시작될 수 있다.
자주 틀리는 부분
- NULL 비율이 높다는 이유만으로 조건부 선택 항목도 오류로 본다.
- PK가 다르면 고객 중복이 아니라고 판단한다.
- 프로파일링 도구가 제시한 이상값을 업무 확인 없이 삭제한다.
- 하류 데이터만 수정하고 다음 적재 때 원천 오류가 다시 덮어쓰게 둔다.
- 오류율만 낮추고 정정으로 인해 보고서·정산 결과가 바뀌는 영향은 검증하지 않는다.
개념 확인 문제
문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.
01[객관식] 프로파일링과 품질 규칙의 관계로 옳은 것은? ① 프로파일링 통계는 항상 오류를 확정한다. ② 품질 규칙은 업무 조건을 포함해 적합 여부를 판정한다. ③ 클렌징은 오류 원인을 자동 제거한다. ④ distinct 수는 어떤 업무에서도 불필요하다.
정답: ②
- ① 통계 이상은 업무상 정상일 수 있어 후보에 가깝다.
- ② 품질 규칙은 적용 조건과 업무 기준으로 판정한다.
- ③ 클렌징은 값 정정이며 입력·변환 원인을 별도 개선해야 한다.
- ④ distinct 수는 유일성·코드 분포·식별자 분석에 유용하다.
02[객관식] 종료일 < 시작일을 탐지하는 규칙의 유형은? ① 단일 열 형식 ② 열 간 관계 ③ 유일성만 ④ 백업 무결성
정답: ②
- 시작일과 종료일 두 열의 상호관계를 검사한다.
- 각 날짜가 형식상 유효해도 순서가 모순될 수 있다.
03[연결형] 매핑 오류, FK 누락, 수동 수정, 외부 지연을 인터페이스·모델/DB·운영·외부 원천과 연결하세요.
정답: 매핑 오류→인터페이스, FK 누락→모델/DB, 수동 수정→운영, 외부 지연→외부 원천.
04[계산형] 검사 대상 주문 50,000건 중 총액-상세합계 규칙을 만족한 주문이 49,500건이다. 일관성 준수율과 오류율을 계산하세요.
정답:
- 일관성 준수율 = 49,500 / 50,000 × 100 = 99%.
- 오류율 = 500 / 50,000 × 100 = 1%.
05[사례 판단] DW 고객 주소 5,000건이 잘못되었고 원천 CRM에도 같은 오류가 있다. 수정·재처리·재발 방지 순서를 설명하세요.
모범 답안:
- CRM이 기준 원천인지 확인하고 오류 원인·정정 근거를 승인한다.
- 원천 CRM을 먼저 정정하고 입력 검증·주소 기준 연계 등 발생 통제를 개선한다.
- 변경분 또는 영향 범위를 DW에 재적재하고 주소를 사용하는 보고서·모델·하류 시스템을 재처리한다.
- 원천·DW의 오류율, 건수 대사와 재발 여부를 검증한다. DW만 직접 수정하면 다음 적재에서 오류가 재발할 수 있다.