현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

데이터 정제의 목적과 절차

오류·중복·형식 불일치를 진단하고 재현 가능한 정제 절차를 익힌다.

예상 읽기 10

핵심 요약

데이터 정제의 목적은 값을 보기 좋게 바꾸거나 분석에 불리한 관측치를 없애는 것이 아니다. 실제 관측 대상과 업무 의미를 보존하면서 정확성·일관성·유효성·고유성·무결성을 높여 분석 가능한 데이터를 만드는 것이 목적이다.

같은 값이 반복되어도 서로 다른 사건일 수 있고, 드문 값도 실제로 발생한 정상 사례일 수 있다. 따라서 정제는 탐지 → 업무 맥락에 따른 판정 → 처리 → 전후 검증 → 기록의 순서로 수행한다. 원본과 정제 결과를 분리하면 규칙을 고치거나 오류를 발견했을 때 재처리할 수 있다.

학습 목표

  • 데이터 정제의 목적과 주요 품질 기준을 설명한다.
  • 오류, 정상 예외, 기술적 중복, 개체 중복을 업무 키와 관측 단위로 구분한다.
  • 프로파일링부터 결과 검증까지 정제 절차를 올바른 순서로 배열한다.
  • 정제와 데이터 검증·변수 변환·데이터 통합의 목적 차이를 판별한다.
  • 정제 전후 지표를 해석하고 삭제·격리·수정 내역을 함께 보고한다.

1. 데이터 정제와 데이터 품질

데이터 정제(data cleansing)는 품질 문제를 찾고 원인에 맞게 수정·표준화·병합·격리·제외하거나 원천에서 다시 수집하는 활동이다. 무엇을 오류로 볼지는 분석 목적, 관측 단위, 업무 규칙에 따라 달라진다.

품질 기준판단 질문문제 예시
정확성값이 실제 대상이나 사건을 올바르게 나타내는가?배송 완료 주문의 상태가 결제 대기로 저장됨
완전성필수 값이 필요한 수준으로 채워져 있는가?배송 주문의 주소가 비어 있음
일관성같은 의미가 시스템·열·시점 사이에서 모순되지 않는가?고객 등급이 CRM과 주문 시스템에서 다름
유효성형식·범위·코드 등 정의된 규칙을 만족하는가?월 값이 13, 허용 코드가 아닌 X9 입력
고유성하나의 사건이나 개체가 불필요하게 중복되지 않았는가?동일 적재 배치가 두 번 실행되어 주문이 중복됨
무결성열 간·테이블 간 관계가 업무 규칙을 만족하는가?주문 본문 없이 주문 항목만 존재함

완전성 문제인 결측값과 분포상 드문 이상값은 각각 별도 단원에서 처리 방법을 자세히 다룬다. 이 단원에서는 정제 전체 절차 속에서 두 문제를 발견하고, 자동 삭제하지 않으며, 처리 근거를 기록해야 한다는 점에 초점을 둔다.

2. 주요 정제 대상

2.1 형식과 자료형

날짜 표기, 숫자 구분자, 문자열 인코딩, 대소문자, 앞뒤 공백을 표준 형식으로 바꾼다. 형식 변환에 실패한 값을 아무 기록 없이 결측값으로 바꾸면 원래 오류가 숨겨지므로 실패 건수와 원본 값을 별도로 남긴다.

2.2 값의 범위와 업무 규칙

나이가 음수이거나 종료일이 시작일보다 빠른 값처럼 단일 열 또는 여러 열의 규칙을 확인한다. 통계적으로 드물다는 사실만으로 오류라고 단정하지 말고 원천 기록과 업무 담당자의 판단을 함께 확인한다.

2.3 단위와 코드

무게·거리·통화처럼 같은 개념이 서로 다른 단위로 저장될 수 있다. 단위 메타데이터, 환산식, 기준일 환율 등 변환 근거가 필요하다. 부서별 코드를 표준 코드로 매핑할 때는 미매핑과 하나의 값이 여러 코드에 연결되는 다중 매핑을 따로 검증한다.

2.4 참조 무결성

주문 항목이 존재하지만 주문 본문이 없거나, 존재하지 않는 고객 ID를 주문이 참조하는 문제를 확인한다. 한 열의 값 범위만 검사해서는 테이블 사이의 관계 오류를 찾을 수 없다.

2.5 중복

완전히 같은 행이 반복 적재된 기술적 중복과 표기가 다른 동일 고객처럼 개체 수준 중복을 구분한다. 동일 고객의 반복 구매는 정상적인 여러 사건이므로 제거 대상이 아니다.

중복 판정 기준활용 방법주의점
기본키·업무 키주문번호, 결제 승인 ID, 센서 이벤트 ID로 사건 식별키 생성 오류나 키 재사용 여부 확인
속성 조합이름·연락처·주소 등 여러 속성을 비교오타·정보 변경·공유 연락처로 오판 가능
시간·공간 근접성짧은 시간 안의 유사 이벤트 비교실제 반복 사건을 삭제할 위험
유사도 점수문자열·주소·기관명 유사도 계산임곗값과 수동 검토 구간 필요

중복을 처리하기 전에는 어떤 레코드를 대표로 남길지도 정해야 한다. 권위 있는 원천, 최신 시각, 정보 완전성 등을 기준으로 병합하되 삭제·병합 대상과 근거를 추적할 수 있어야 한다.

3. 데이터 정제 절차

분석 목적과 관측 단위 정의에서 시작해 원본 보존, 프로파일링, 규칙 정의, 판정과 처리, 전후 검증 및 기록으로 이어지며 검증 실패 시 규칙 정의로 되돌아가는 데이터 정제 절차
분석 목적과 관측 단위 정의에서 시작해 원본 보존, 프로파일링, 규칙 정의, 판정과 처리, 전후 검증 및 기록으로 이어지며 검증 실패 시 규칙 정의로 되돌아가는 데이터 정제 절차
  1. 목적과 관측 단위 정의: 고객·주문·센서 이벤트처럼 무엇을 한 건으로 볼지 정한다.
  2. 원본 보존과 프로파일링: 원본을 변경하지 않고 자료형, 값의 범위, 빈도, 결측, 고유값, 키 중복을 요약한다.
  3. 규칙과 예외 정의: 탐지 조건, 허용 예외, 처리 방법, 담당자, 규칙 버전을 정한다.
  4. 탐지 결과 판정: 후보를 정상·정상 예외·오류·판단 보류로 나눈다.
  5. 처리 적용: 수정·표준화·병합·격리·제외·원천 재수집 중 근거에 맞는 방법을 선택한다.
  6. 전후 검증과 기록: 행 수, 키, 분포, 합계, 참조 관계를 비교하고 처리 건수와 이력을 기록한다.

검증 결과가 기대와 다르면 규칙을 수정하고 원본에서 다시 실행한다. 반복되는 오류는 분석 단계에서 계속 고치는 데 그치지 말고 원천 입력 검증이나 인터페이스를 개선해 재발을 줄인다.

4. 정제 방법 선택

방법적절한 상황확인할 사항
수정원천 근거로 올바른 값을 확인할 수 있음수정 출처와 이전 값 보존
표준화같은 의미가 여러 형식·단위·코드로 표현됨변환 규칙과 기준일
병합동일 개체의 정보가 여러 레코드에 나뉨대표 레코드와 충돌 해결 기준
격리오류 가능성이 높지만 즉시 확정하기 어려움분석 제외와 재검토 절차
제외분석 목적상 사용할 수 없고 근거가 명확함제외 건수와 편향 가능성
원천 재수집수정 근거가 없고 다시 얻을 수 있음재수집 비용과 원천 시스템 품질

삭제는 여러 선택지 중 하나일 뿐 기본값이 아니다. 오류 제거가 특정 집단의 데이터를 더 많이 없애는지 확인하지 않으면 표본 구성이 달라져 분석 결과가 편향될 수 있다.

5. 정제 전후 검증과 계산

정제 후 행 수가 줄었다는 사실만으로 품질이 좋아졌다고 판단할 수 없다. 다음 항목을 정제 전후에 함께 비교한다.

  • 전체 행 수, 업무 키의 고유 개수, 중복 건수
  • 필수 열의 결측 건수와 규칙 위반 건수
  • 범주별 빈도, 최솟값·최댓값, 분포 변화
  • 금액·수량 등의 통제 합계와 원천 시스템 합계
  • 외래키 등 참조 무결성 위반 건수
  • 수정·병합·격리·제외·재수집 건수

유효성 비율은 다음처럼 정의할 수 있다.

유효성 비율(%) = (V) ÷ (N) × 100
  • $N$: 검사 대상 값 수이며 $N>0$이어야 한다.
  • $V$: 유효성 규칙을 만족한 값 수이며 $0 \le V \le N$이다.
  • 결과 범위는 0% 이상 100% 이하이다.
  • $N=0$이면 0%라고 계산하지 않고 해당 없음(N/A)으로 보고한다.

정상 예: 날짜 10,000개 중 9,982개가 규칙을 만족하면 유효성 비율은 $9{,}982 / 10{,}000 \times 100 = 99.82%$이다.

경계 예: 필터 결과 검사 대상이 0개라면 분모가 0이므로 비율은 정의할 수 없다. 이때 0%로 기록하면 모든 값이 잘못됐다는 뜻으로 오해될 수 있으므로 N/A와 대상 건수 0을 함께 표시한다.

정제 후 유효성 비율이 100%가 되었더라도 오류 행을 대량 제외해 분모가 줄었다면 품질이 무조건 개선됐다고 볼 수 없다. 비율과 함께 제외·격리 건수와 데이터 분포 변화를 보고해야 한다.

6. 다른 전처리 활동과의 구분

활동핵심 질문대표 작업
데이터 검증규칙을 만족하는가?형식·범위·키·참조 관계 검사
데이터 정제발견된 품질 문제를 어떻게 처리하고 확인할 것인가?수정·표준화·병합·격리·제외·재수집
변수 변환분석 방법에 맞게 표현을 어떻게 바꿀 것인가?로그 변환, 표준화, 최소-최대 스케일링
데이터 통합여러 원천을 어떤 기준으로 결합할 것인가?스키마 매핑, 키 매칭, 원천 간 충돌 해결

검증은 문제를 찾는 활동이고 정제는 발견된 문제를 처리하는 활동이지만 실제 파이프라인에서는 반복해서 수행된다. 변수 변환은 올바른 값을 분석에 적합한 표현으로 바꾸는 것이므로 오류 수정과 목적이 다르다.

7. 사례 적용

상황: 음식 배달 주문 10,000건에서 동일 고객·금액·시각의 레코드가 반복됐다. 일부는 적재 배치가 두 번 실행되어 생긴 기술적 중복이고, 일부는 한 고객이 두 매장에서 동시에 주문한 정상 거래다. 날짜 형식 오류도 18건 발견됐다.

판단 과정:

  1. 주문 한 건을 관측 단위로 정하고 주문번호와 결제 승인 ID를 업무 키로 삼는다.
  2. 동일 업무 키와 동일 원천 배치 ID가 반복된 120건은 기술적 중복 후보로 분류한다.
  3. 주문번호와 매장이 다른 거래는 고객·금액·시각이 같아도 독립 주문으로 보존한다.
  4. 날짜 오류 18건 중 원천에서 확인 가능한 12건은 수정하고, 근거가 없는 6건은 격리한다.
  5. 원본은 보존하고 중복 제거 120건, 수정 12건, 격리 6건을 처리 이력에 기록한다.
  6. 정제된 분석 테이블 9,874건의 주문 수·결제 합계를 원천 승인 내역과 대조하고 집단별 분포 변화를 확인한다.

결론: 값의 유사성보다 관측 사건을 식별하는 업무 키와 발생 맥락이 우선이다. 정제 결과만 제시하지 말고 제거·수정·격리 건수와 통제 합계 검증 결과를 함께 보고해야 한다.

분석 목적과 관측 단위 정의에서 원본 보존, 프로파일링, 규칙 정의, 판정과 처리, 전후 검증·기록으로 이어지고 실패 시 규칙으로 돌아가는 정제 절차
분석 목적과 관측 단위 정의에서 원본 보존, 프로파일링, 규칙 정의, 판정과 처리, 전후 검증·기록으로 이어지고 실패 시 규칙으로 돌아가는 정제 절차

정제는 삭제 작업이 아니라 목적·관측 단위를 정하고 원본을 보존한 뒤 프로파일링, 규칙 정의, 판정·처리, 검증·기록을 반복하는 통제 절차다. 검증에 실패하면 처리 결과를 덮어쓰지 않고 규칙과 원천 진단으로 돌아간다.

예시 데이터에서 정제 전후 결측률, 중복률, 규칙 위반률이 각각 얼마나 낮아졌는지 비교한 막대그래프
예시 데이터에서 정제 전후 결측률, 중복률, 규칙 위반률이 각각 얼마나 낮아졌는지 비교한 막대그래프

예시에서는 결측률 12%→3%, 중복률 7%→1%, 규칙 위반률 9%→2%로 낮아졌다. 같은 분모·규칙·기간으로 비교해야 하며 낮아진 수치만 보지 말고 수정·격리·보존 건수와 업무 영향도 기록한다.

오류율=(오류\ 판정\ 건수) ÷ (검사\ 대상\ 건수)×100%
검증질문완료 증거
건수·키행이 유실·중복되지 않았는가전후 건수·고유키 대사
규칙범위·형식·참조무결성을 지키는가위반 건수와 처리 이력
분포중심·산포·범주비율이 왜곡되지 않았는가전후 분포와 집단별 비교

시험 판단 포인트

  • 정제는 오류 탐지뿐 아니라 판정, 처리, 전후 검증, 이력 기록을 포함한다.
  • 중복은 행의 동일성보다 관측 단위와 업무 키를 기준으로 판단한다.
  • 드문 값, 정상 반복 사건, 실제 오류를 구분하며 이상값을 자동 삭제하지 않는다.
  • 원본을 보존하고 규칙 버전·예외·처리 건수를 남겨 재현성과 감사 가능성을 확보한다.
  • 유효성 비율이 상승해도 제외 건수와 분포 변화가 크면 편향 가능성을 확인한다.
  • 반복 오류는 원천 시스템의 예방 통제 개선으로 연결한다.

자주 틀리는 부분

  • 같은 고객의 여러 거래를 고객 중복으로 보고 삭제하지 않는다.
  • 형식 변환 실패를 기록 없이 결측값으로 바꾸지 않는다.
  • 정제 후 행 수가 같거나 유효성 비율이 높다는 한 지표만으로 품질을 단정하지 않는다.
  • 평균·최빈값 대체를 모든 오류의 공통 정제 방법으로 사용하지 않는다.
  • 검증과 정제를 완전히 같은 말로 보거나, 정제와 로그 변환·스케일링의 목적을 혼동하지 않는다.
  • 원본을 덮어쓰지 않고 정제 결과와 처리 이력을 분리해 보존한다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01데이터 정제의 목적을 정확히 설명하시오.
정답 및 해설

업무 의미를 보존하며 오류·중복·불일치를 처리하고 전후 결과를 검증한다.

02데이터 정제 절차의 적절한 순서를 서술하시오.
정답 및 해설

목적·관측 단위 정의 → 원본 보존·프로파일링 → 규칙·예외 정의 → 판정·처리 → 전후 검증·기록

03날짜 10,000개 중 유효성 규칙을 만족한 값이 9,982개일 때 유효성 비율은?
정답 및 해설

99.82%

04동일 고객·금액·시각이지만 매장·주문번호·결제 승인 ID가 서로 다른 두 레코드가 있다. 어떻게 판단해야 하는지 근거와 함께 서술하시오.
정답 및 해설

서로 다른 주문 사건일 수 있으므로 업무 키와 원천 승인 내역을 확인한 뒤 보존 여부를 결정한다.