현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

데이터 품질 검증과 저장 구조

데이터 품질 기준과 분석 목적에 맞는 저장 구조를 선택한다.

예상 읽기 15

핵심 요약

데이터 품질은 ‘오류가 전혀 없는 상태’가 아니라 특정 목적에 적합한 상태다. 모든 값이 존재해도 단위가 다르면 일관성과 정확성이 낮을 수 있고, 형식이 올바른 값도 실제 사실과 다르면 유효하지만 부정확할 수 있다. 품질 차원, 측정식의 분모, 허용 임계치, 예외, 책임자와 조치를 함께 정의해야 한다.

프로파일링은 값의 분포와 패턴을 관찰해 문제 후보를 찾고, 규칙 검증은 업무상 허용 조건의 통과 여부를 판정한다. 대사는 원천과 목표의 건수·금액·키 등을 맞춰 누락·중복·부분 반영을 찾고, 모니터링은 품질 변화와 재발 여부를 추적한다.

저장소는 이름이나 유행으로 선택하지 않는다. 반복 보고에는 통합 정의와 분석 성능이 중요하고, 원본·비정형 데이터 탐색에는 유연한 보존과 메타데이터가 중요하며, 거래 처리에는 무결성과 동시 갱신이 중요하다. 파티션과 복제는 각각 데이터 분할과 가용성에 관한 설계이며 백업·복구를 대체하지 않는다.

학습 목표

  • 품질 차원을 업무 목적과 측정 가능한 규칙으로 연결한다.
  • 프로파일링·규칙 검증·대사·모니터링을 구분한다.
  • 품질률의 분모·임계치·예외와 오류 조치를 설계한다.
  • 관계형 DB·NoSQL·데이터웨어하우스·데이터레이크·분산 저장의 선택 축을 구분한다.
  • 행·열 지향, 파티션, 복제, 백업의 역할을 판정한다.
  • 적재 완료를 품질·메타데이터·계보·보안·복구 관점에서 검증한다.

1. 목적 적합성과 데이터 품질 차원

품질 차원 명칭과 분류는 기관·표준에 따라 조금씩 다를 수 있다. 하나의 목록을 절대 기준으로 외우기보다, 어떤 업무 위험을 측정하는지 구분하는 것이 중요하다. 영국 정부 데이터 품질 프레임워크도 정확성·완전성·유일성·일관성·적시성·유효성의 여섯 차원을 권고하면서 목적에 맞는 차원을 선택하도록 설명한다.

품질 차원판단 질문규칙 예시다른 차원과의 구분
정확성값이 실제 사실이나 권위 원천과 맞는가?결제 금액이 승인 원장과 일치형식이 맞아도 실제 값이 틀리면 부정확
완전성필요한 레코드와 필수값이 존재하는가?필수 주문번호 결측률 0%모든 값이 있어도 값 자체가 맞는지는 별도
유효성자료형·형식·범위·허용코드를 지키는가?수량은 1 이상의 정수규칙에 맞는 값이 실제 사실과 다를 수 있음
일관성레코드·시스템·시점 사이에 모순이 없는가?주문 총액과 항목 합계가 일치단일 열 형식보다 값 사이의 관계에 초점
적시성필요한 시점에 최신 데이터가 제공되는가?재고 지연이 5분 이내과거에는 정확했던 값도 시간이 지나면 부적합
유일성같은 업무 대상을 중복 없이 식별하는가?주문 업무 키의 초과 중복 0건기본키 값이 달라도 같은 실체가 중복될 수 있음

예를 들어 고객 주소 서울시 ...가 형식 규칙을 통과하면 유효할 수 있다. 그러나 고객이 이사했다면 정확성과 적시성이 낮다. 품질 차원은 서로 대체되지 않으므로 ‘결측률 0%’ 하나로 전체 품질을 판정하지 않는다.

2. 측정식·분모·임계치

품질 규칙은 ‘좋다/나쁘다’가 아니라 계산 가능한 형태로 정의한다.

[ 완전성률 = \frac{존재하는\ 필수값\ 수}{기대하는\ 필수값\ 수} \times 100 ]

[ 유효성률 = \frac{유효성\ 규칙을\ 통과한\ 값\ 수}{검사\ 대상\ 값\ 수} \times 100 ]

[ 유일성률 = \frac{전체\ 레코드\ 수-초과\ 중복\ 레코드\ 수}{전체\ 레코드\ 수} \times 100 ]

  • 기대하는 필수값 수: 해당 기간·범위에 존재해야 하는 필수값의 수
  • 검사 대상 값 수: 결측값을 포함할지 제외할지 규칙에서 명시한 분모
  • 초과 중복 레코드 수: 한 업무 대상을 대표하는 첫 레코드 외에 중복으로 판정된 레코드 수
  • 값의 범위: 각 비율은 분모가 양수일 때 0~100%다.
  • 경계 조건: 분모가 0이면 100%로 간주하지 않고 측정 불가 또는 해당 없음으로 구분한다.
측정 예계산결과해석
필수 주문번호 1,000개 중 992개 존재992/1,000×10099.2%임계치가 99.5%라면 실패
검사 대상 992개 중 982개가 허용 형식982/992×100약 99.0%완전성 분모와 유효성 분모가 다름
1,000행에서 초과 중복 6행(1,000-6)/1,000×10099.4%업무 키 정의가 먼저 필요
기대 건수가 0인 휴무일0/0측정 불가실패·성공과 구분해 기록

전체 점수의 평균이 높아도 치명적 오류를 가릴 수 있다. 결제 원장 불일치나 법정 필수값 누락은 평균 점수와 별도로 ‘한 건이라도 실패하면 차단’하는 하드 게이트로 정의할 수 있다.

3. 품질 규칙의 구성

규칙 요소확인 질문예시
업무 목적·대상무엇을 보호하고 어느 데이터에 적용하는가?일별 결제 정산, 승인 완료 거래
품질 차원어떤 종류의 문제를 측정하는가?정확성·완전성
계산식·분모어떻게 측정하며 제외 조건은 무엇인가?승인 건 중 원장 일치 건 비율
임계치·심각도어느 수준부터 경고·차단하는가?100% 미만이면 BLOCKER
예외·유효기간허용 예외와 적용 시점은?승인 취소 대기 10분, 규칙 v3
책임·조치누가 무엇을 수정하고 재검증하는가?결제 담당 확인 후 동일 배치 재처리
증거·계보원인과 결과를 어떻게 추적하는가?원천 ID·배치 ID·규칙 버전·오류 코드

규칙은 구현 코드만이 아니라 데이터 생산자와 소비자 사이의 계약이다. 데이터 구조·업무 정책이 바뀌면 규칙 버전과 임계치를 함께 변경하고, 과거 데이터에 어느 버전을 적용했는지 남긴다.

4. 프로파일링·검증·대사·모니터링

활동핵심 질문대표 결과주의점
프로파일링어떤 분포·패턴·관계가 존재하는가?결측률, 고유값, 범위, 빈도, 길이, 키 후보희귀값·극단값을 즉시 오류로 확정하지 않음
규칙 검증정의된 허용 조건을 통과하는가?통과율, 실패 행, 오류 코드업무 정의·분모·임계치가 필요
대사원천과 목표가 수량·금액·키 관점에서 맞는가?건수·합계·키 집합·시간 범위 차이건수만 같아도 누락과 중복이 상쇄될 수 있음
모니터링품질이 시간에 따라 악화·재발하는가?추세, 경보, 서비스 수준, 재발률단일 실행의 통과만으로 종료하지 않음

프로파일링에서 이상을 발견하면 업무 담당자와 정상 극단값·예외·오류를 구분한다. 오류는 조용히 삭제하거나 임의로 평균값으로 바꾸지 않고, 원본을 보존한 채 격리·수정·재처리·예방 중 적절한 조치를 선택한다.

5. 품질 관리 절차

  1. 목적과 중요 데이터 식별: 잘못되면 의사결정·정산·안전에 큰 영향을 주는 핵심 데이터 요소를 정한다.
  2. 규칙 설계: 차원, 계산식, 분모, 임계치, 예외, 심각도와 책임자를 명시한다.
  3. 프로파일링과 기준선 수립: 현재 분포와 반복 패턴을 파악해 규칙 후보와 정상 범위를 정한다.
  4. 규칙 실행과 대사: 오류 행뿐 아니라 원천-목표 누락·중복·합계 차이를 검증한다.
  5. 원인 추적: 수집·변환·적재·저장 중 어느 단계와 규칙 버전에서 문제가 생겼는지 찾는다.
  6. 조치와 재검증: 차단·격리·경고·수정·재처리 중 위험에 맞는 조치를 적용하고 같은 규칙으로 다시 검증한다.
  7. 예방과 모니터링: 원천 입력 통제·데이터 계약·경보를 개선하고 품질 추세와 재발을 확인한다.

품질 오류를 목표 저장소에서만 고치면 같은 문제가 다시 유입될 수 있다. 가능한 경우 오류가 발생한 가장 앞 단계의 통제를 개선하고, 이미 만들어진 결과는 계보를 이용해 영향 범위를 찾는다.

6. 저장 구조를 선택하는 두 개의 축

저장 구조는 다음 두 축을 분리해서 판단한다.

  • 논리적 활용 구조: 거래 처리, 통합 분석, 원본 보존·탐색처럼 무엇을 위해 저장하는가?
  • 물리적 구현 방식: 단일·분산, 행·열 지향, 파티션, 복제, 객체·블록·파일 등 어떻게 저장하는가?

데이터웨어하우스와 데이터레이크는 주로 논리적 활용 구조를 설명한다. 분산 파일시스템이나 객체 저장소는 물리적 저장 방식이며, 하나의 데이터레이크나 데이터웨어하우스가 분산 저장 위에 구현될 수 있다. 따라서 ‘웨어하우스인가 분산 저장인가’는 서로 배타적인 선택이 아니다.

7. 주요 저장 구조와 선택 조건

구조강점·적합 용도주의점대표 선택 질문
관계형 DB거래 무결성, 제약조건, 조인, 동시 갱신수평 확장·비정형 처리 비용다중 행 갱신과 일관된 거래가 중요한가?
키-값·문서형 NoSQL단순 키 조회, 유연한 문서 구조, 수평 확장조인·제약·일관성 모델을 별도 검토접근 패턴이 키 중심이고 구조 변경이 잦은가?
데이터웨어하우스통합 정의, 반복 보고, 대규모 SQL 집계사전 모델링과 적재·변환 관리공통 지표와 안정된 분석 스키마가 필요한가?
데이터레이크원본·정형·반정형·비정형 보존, 탐색·재가공카탈로그·소유자·품질 구역 없으면 데이터 늪 위험원본 보존과 다양한 후속 활용이 필요한가?
분산 파일·객체 저장대용량 파일의 확장, 병렬 처리, 장애 대응작은 파일, 메타데이터, 갱신·일관성 특성큰 데이터의 처리량과 수평 확장이 중요한가?

한 시스템에서 여러 구조를 조합할 수 있다. 예를 들어 주문은 관계형 DB에서 처리하고, 변경 이력은 데이터레이크에 보존하며, 검증된 통합 지표는 데이터웨어하우스에서 제공할 수 있다. 중요한 것은 동일 데이터의 소유권·동기화 기준·계보를 명확히 하는 것이다.

8. 행·열 지향과 파일 형식

구분행 지향열 지향
저장 단위한 레코드의 열을 함께 저장같은 열의 값을 함께 저장
적합 작업개별 행 조회·삽입·갱신일부 열의 대량 스캔·집계
장점거래 처리와 전체 레코드 접근압축과 분석 집계 효율
주의점대량 집계 시 불필요한 열 읽기잦은 단건 갱신·전체 행 복원 비용

CSV·JSON 같은 텍스트 형식은 교환과 원본 확인에 편리하지만 자료형·압축·열 단위 읽기 효율이 제한될 수 있다. Parquet 같은 열 지향 형식은 분석용 스캔과 압축에 유리하다. 파일 형식 선택은 저장소 이름과 별개이며, 데이터 크기·스키마·조회 패턴·호환성을 함께 본다.

9. 파티션·복제·백업의 구분

개념목적잘못된 판단필수 검증
파티션데이터를 키·범위·시간 등으로 나눠 병렬 처리와 가지치기 지원파티션 수가 많을수록 항상 빠름키 편중, 작은 파일, 누락 파티션, 조회 조건
복제여러 사본을 두어 노드 장애 시 가용성 확보복제본이 있으므로 삭제·오염도 복구 가능복제 수, 배치 위치, 복제 지연, 일관성
백업별도 시점·매체에 복구 가능한 사본 보존백업 파일 존재만으로 복구 보장보존주기, 암호화, 무결성, 실제 복원 시험
체크포인트·로그마지막 안전 상태와 변경 이력으로 재개·재처리체크포인트를 성공 전에 전진성공 기준, 멱등성, 로그 보존, 재실행 범위

분산 파일시스템은 파일을 블록으로 나누고 복제해 장애에 대응할 수 있다. 복제는 가용성을 높이지만 사용자 삭제, 잘못된 갱신, 논리적 오염도 함께 복제할 수 있으므로 버전·백업·복구 절차가 별도로 필요하다.

10. 적재·저장 완료 검증

검증 영역확인 항목실패 시 조치 예시
내용 품질필수값, 범위, 코드, 중복, 업무 관계차단·격리·원천 수정
원천-목표 대사건수, 키 집합, 합계, 시간 범위, 삭제 반영누락 구간 재추출·멱등 재처리
스키마·파일버전, 자료형, 호환성, 파일 수·크기이전 버전 유지·계약 위반 차단
파티션·물리 무결성파티션 누락·편중, 체크섬, 복제 상태재분배·재복제·손상 파일 복구
메타데이터·계보소유자, 의미, 원천, 규칙·배치 버전카탈로그 보완·영향 범위 추적
보안·보존권한, 암호화, 민감정보, 보존·파기접근 차단·키 교체·정책 적용
복구 가능성백업 무결성, 복원 시간, 재처리 기준점복원 훈련·절차와 용량 보완

파일 또는 테이블이 생성됐다는 사실만으로 성공 처리하지 않는다. 스테이징에서 검증한 뒤 운영 영역에 원자적으로 공개하고, 검증·반영이 성공한 후에만 체크포인트를 전진시킨다.

11. 사례 적용

11.1 전국 매장 재고 통합

상황: 일부 매장은 재고를 박스 단위, 일부는 낱개 단위로 전송한다. 모든 레코드는 숫자이며 결측은 없다.

판단 과정:

  1. 완전성과 유효성만으로 통과시키지 않고 단위 일관성과 실제 재고 정확성을 규칙으로 만든다.
  2. 매장·상품별 단위 메타데이터를 확인해 표준 단위로 변환한다.
  3. 변환 전후 수량·출고·입고 합계를 대사하고 불명확한 행은 격리한다.
  4. 통합 재고의 반복 집계에는 데이터웨어하우스를 사용할 수 있지만, 원본 파일과 변환 규칙은 재처리를 위해 별도 보존한다.
  5. 오류 매장의 입력 화면과 데이터 계약을 수정해 재발을 방지한다.

결론: 결측률 0%는 완전성의 일부만 설명한다. 단위 의미가 다르면 정확성과 일관성에 실패하며 저장소를 바꾸는 것만으로 해결되지 않는다.

11.2 클릭 로그 저장

상황: 초당 대량의 반정형 클릭 이벤트를 원본 그대로 보존하고, 다음 날 사용자 행동을 집계해야 한다.

판단: 원본 이벤트는 확장 가능한 파일·객체 기반 데이터레이크에 시간 단위로 파티션하고, 스키마·소유자·품질 상태를 카탈로그에 기록한다. 검증된 일별 지표는 열 지향 형식이나 데이터웨어하우스에 제공할 수 있다. 사용자 ID 편중, 작은 파일, 늦게 도착한 이벤트와 중복 이벤트를 별도로 검증한다.

데이터 프로파일링에서 품질 규칙 정의, 검증과 대사, 원인 조치, 모니터링을 거쳐 규칙을 개선하는 순환
데이터 프로파일링에서 품질 규칙 정의, 검증과 대사, 원인 조치, 모니터링을 거쳐 규칙을 개선하는 순환

프로파일링은 분포·결측·이상값을 탐색해 현상을 발견하고, 품질 규칙 검증은 명시한 기준을 통과했는지 판정한다. 대사는 원천과 대상의 건수·합계·키를 비교하며 원인 조치와 모니터링 결과가 다음 규칙 개선으로 돌아간다.

필수값 전체 건수를 $N$, 존재하는 건수를 $N_{present}$, 규칙을 만족한 건수를 $N_{valid}$라 하면 분모를 명시한 대표 지표는 다음과 같다.

완전성률=\fracN_presentN×100%, 유효성률=\fracN_validN×100%

필수 주문번호 500개 중 492개가 있으면 완전성률은 $492/500=98.4%$다. 98.4%가 좋은지 여부는 사전에 정한 임계치와 오류 비용으로 판단한다.

가로축 데이터 구조의 유연성, 세로축 접근 패턴을 두어 데이터웨어하우스, 데이터레이크, 키값 저장소, 열지향 분석 저장소의 적합 위치를 비교한 매트릭스
가로축 데이터 구조의 유연성, 세로축 접근 패턴을 두어 데이터웨어하우스, 데이터레이크, 키값 저장소, 열지향 분석 저장소의 적합 위치를 비교한 매트릭스

저장 구조는 정형·비정형 여부만으로 선택하지 않고 접근 패턴, 일관성, 지연, 비용, 보안과 운영 역량을 함께 평가한다. 반복 보고용 통합 지표는 데이터웨어하우스나 열지향 분석 저장소, 대규모 원형·반정형 자료는 데이터레이크가 적합한 후보가 될 수 있다.

저장 구조강한 요구주의점
데이터웨어하우스정형 통합·반복 보고·일관 지표스키마 변경과 원형 데이터 유연성
데이터레이크대규모 원형·반정형 저장카탈로그·품질 없으면 늪이 될 수 있음
키-값·문서 저장소낮은 지연 조회·유연한 구조복잡한 조인·통합 분석
열지향 분석 저장대규모 집계·스캔행 단위 빈번한 갱신

시험 판단 포인트

  • 품질 차원은 목적에 맞게 선택하며 완전성·유효성·정확성은 서로 다른 개념이다.
  • 품질률에는 계산식·분모·임계치·예외가 필요하고 분모 0은 자동 100%가 아니다.
  • 프로파일링은 문제 후보 탐색, 규칙 검증은 허용 조건 판정, 대사는 원천-목표 비교다.
  • 평균 품질 점수가 높아도 치명적 규칙은 별도 하드 게이트로 차단할 수 있다.
  • 데이터웨어하우스·데이터레이크는 활용 구조이고 분산 저장은 구현 방식이므로 함께 조합될 수 있다.
  • 관계형 DB와 NoSQL은 데이터 크기만이 아니라 거래·제약·조회·갱신 패턴으로 선택한다.
  • 파티션은 분할, 복제는 가용성, 백업은 복구가 목적이다.
  • 저장 완료는 내용·대사·스키마·파티션·계보·보안·복구까지 검증해야 한다.

자주 틀리는 부분

  • 결측이 없으면 정확성과 일관성도 높다고 보지 않는다.
  • 형식에 맞는 값은 반드시 실제 사실과도 일치한다고 판단하지 않는다.
  • 이상값을 모두 삭제하거나 평균으로 바꾸는 것이 품질 개선이라고 보지 않는다.
  • 데이터레이크는 스키마와 품질 관리가 전혀 필요 없다고 보지 않는다.
  • 데이터웨어하우스와 분산 저장을 서로 배타적인 구조로 보지 않는다.
  • NoSQL은 언제나 관계형 DB보다 빠르거나 일관성이 없다고 단정하지 않는다.
  • 파티션 수와 복제 수를 늘리면 성능·안전성이 항상 좋아진다고 보지 않는다.
  • 복제본이 있으면 백업과 복원 시험이 필요 없다고 판단하지 않는다.

참고한 공식 기술 자료

스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01필수 주문번호 500개 중 492개가 존재한다. 완전성률은?
정답 및 해설

98.4%

완전성률은 492/500×100=98.4%다. 분자는 존재하는 필수값 수, 분모는 기대하는 필수값 수다.

02프로파일링과 품질 규칙 검증의 비교를 서술하시오.
정답 및 해설

프로파일링은 분포와 패턴을 관찰하고, 규칙 검증은 정의된 업무 조건의 통과 여부를 판정한다.

프로파일링은 결측률·분포·빈도·관계 등을 관찰해 문제 후보를 찾고, 품질 규칙은 업무상 허용 조건과 임계치를 기준으로 통과 여부를 판정한다.

03반복 보고용 통합 지표와 대규모 반정형 원본을 함께 관리하려는 설계를 서술하시오.
정답 및 해설

원본은 카탈로그가 있는 데이터레이크에 보존하고, 검증된 통합 지표는 데이터웨어하우스에서 제공하며 계보를 연결한다.

원본·반정형 데이터의 유연한 보존과 반복 보고용 통합 지표는 요구가 다르므로 데이터레이크와 데이터웨어하우스를 조합할 수 있다. 원천부터 지표까지 계보와 품질 상태를 연결해야 한다.

04복제와 백업에 관해 올바르게 설명하시오.
정답 및 해설

복제는 가용성을 높이고 백업은 시점 복구를 지원하므로 목적과 검증이 다르다.

복제는 노드 장애에도 서비스를 계속하기 위한 가용성 수단이고, 백업은 삭제·오염·재해 시 특정 시점으로 복원하기 위한 수단이다. 두 경우 모두 실제 검증이 필요하다.