현재 선택한 빅데이터 분석 과정

빅데이터분석기사 필기 이론 학습

이론 목록으로 돌아가기

빅데이터 플랫폼과 분석 생태계

수집부터 활용까지 이어지는 플랫폼 구조와 계층별 선택 기준을 살펴본다.

예상 읽기 10

핵심 요약

빅데이터 플랫폼은 특정 서버나 제품 하나가 아니다. 다양한 원천의 데이터를 안전하게 받아 보존하고, 배치 또는 스트림 방식으로 처리하며, 분석 결과를 API·보고서·대시보드·업무 시스템에 제공하는 전체 기술·관리 환경이다. 메타데이터, 품질, 접근 권한, 보존 정책, 모니터링은 특정 계층 하나가 아니라 전체 흐름에 적용된다.

모든 데이터를 같은 구조로 처리할 필요는 없다. 시간에 민감한 경보는 스트림 경로가, 완전성과 재현성이 중요한 정산은 원본 기반 배치 경로가 적합할 수 있다. 데이터웨어하우스는 통합·정제된 반복 분석에, 데이터레이크는 다양한 원본의 유연한 보존과 탐색에 상대적 강점이 있다. 두 접근 모두 메타데이터와 품질 관리가 필요하다.

플랫폼 설계의 핵심은 “가장 유명한 기술은 무엇인가?”가 아니라 “누가 어떤 데이터를 언제, 어느 품질 수준으로 사용하며 실패하면 어떻게 복구할 것인가?”를 먼저 답하는 것이다.

학습 목표

  • 빅데이터 플랫폼의 계층과 횡단 관리 기능을 설명한다.
  • 배치 처리와 스트림 처리의 적용 조건과 오류 통제를 구분한다.
  • 데이터웨어하우스·데이터레이크·레이크하우스의 상대적 목적을 비교한다.
  • 업무 요구에서 데이터 흐름과 기술 선택으로 이어지는 설계 순서를 판정한다.

1. 플랫폼의 계층과 데이터 흐름

데이터는 보통 원천 → 수집 → 저장 → 처리 → 분석 → 제공의 흐름을 거친다. 실제 플랫폼에서는 이 흐름을 오케스트레이션하고, 품질·보안·메타데이터·모니터링을 전 구간에 적용한다.

계층핵심 기능대표 확인 사항실패 시 영향
데이터 원천업무 DB, 파일, 로그, 센서, 외부 API에서 데이터 생성소유자, 갱신 주기, 형식, 사용 조건출처 불명, 기준 시점 혼란
수집·수신파일·변경 데이터·이벤트를 플랫폼으로 전달누락, 중복, 순서, 재전송, 인증데이터 유실 또는 중복 집계
저장원본·정제·분석용 데이터를 목적별 보존형식, 파티션, 보존 기간, 암호화, 복구조회 지연, 복구 불가, 과잉 보관
처리배치 작업과 연속 이벤트 계산 수행병렬화, 상태, 재실행, 지연 이벤트결과 불일치, 처리 지연
분석탐색·통계·모형 학습·검증데이터 버전, 재현성, 평가 기준검증 불가, 결과 재생산 실패
제공·활용API·보고서·대시보드·업무 시스템에 전달사용자, 지연시간, 승인, 장애 대체잘못된 결정 또는 서비스 중단

1.1 수집에서 확인할 것

수집 성공 메시지만으로 완전한 수집을 보장할 수 없다. 원천 건수나 이벤트 식별자와 비교해 누락을 확인하고, 재전송으로 같은 이벤트가 두 번 들어오는 상황을 통제해야 한다. 도착 순서가 실제 발생 순서와 다를 수 있다는 점도 고려한다.

1.2 저장에서 확인할 것

원본 보존 영역, 정제 영역, 분석·제공용 영역을 나눌 수 있다. 모든 원본을 무기한 저장하는 것이 정답은 아니다. 목적, 재처리 가능성, 규정, 비용에 맞춰 보존 기간과 접근 권한을 정한다. 파티셔닝은 자주 조회하는 기간·키와 데이터 분포를 고려해 설계한다.

1.3 처리에서 확인할 것

분산 처리는 데이터를 여러 작업으로 나누어 처리량과 확장성을 높일 수 있다. 반면 네트워크 전송, 작업 조정, 데이터 재분배, 장애 복구 비용이 생긴다. 데이터가 크다는 이유만으로 모든 작업을 분산화하지 않고 병렬화 이득이 추가 복잡성보다 큰지 판단한다.

1.4 분석·제공에서 확인할 것

분석에는 사용 데이터와 코드·모형·평가 결과의 버전을 남겨야 한다. 운영 시스템에 연결되는 결과는 승인 기준, 지연시간, 모니터링, 장애 시 대체 절차도 필요하다. 단순 보고서라면 모형 재학습 체계까지 항상 요구되는 것은 아니지만 기준 시점과 재현 근거는 남겨야 한다.

2. 배치 처리와 스트림 처리

구분배치 처리스트림 처리
입력일정 범위로 모은 데이터 묶음계속 도착하는 이벤트
결과 시점정해진 주기나 작업 완료 후짧은 지연시간으로 연속 갱신
적합 사례일별 집계, 월간 정산, 전체 재학습이상 거래 경보, 설비 감시, 실시간 추천 특징
핵심 통제기준 시점, 재실행, 전체 성공·실패중복, 순서, 지연 이벤트, 상태와 윈도우
상대적 강점완전한 범위의 재계산과 재현시간 민감한 변화에 빠른 대응
대표 과설계필요한 시점보다 주기가 지나치게 김실시간이 불필요한 업무까지 복잡하게 구성

두 방식은 배타적이지 않다. 스트림으로 빠른 임시 결과를 만들고, 원본을 이용한 배치 재계산으로 최종 결과를 확정할 수 있다.

이벤트 발생 시각과 도착 시각

이벤트가 실제로 발생한 시각과 플랫폼에 도착한 시각은 다를 수 있다. 통신 지연 때문에 늦게 도착한 이벤트를 단순히 다음 구간에 넣으면 실제 시간대의 집계가 왜곡된다. 스트림 처리에서는 어떤 시각을 기준으로 윈도우를 계산할지, 늦은 이벤트를 얼마 동안 허용하고 결과를 수정할지를 정해야 한다.

중복 이벤트도 고려한다. “한 번만 처리”라는 문구를 제품 기능처럼 외우기보다 이벤트 식별자, 멱등성 있는 처리, 체크포인트와 재처리 규칙으로 최종 결과의 중복 반영을 막는다고 이해한다.

3. 저장·분석 환경의 구분

구분데이터웨어하우스데이터레이크레이크하우스
주된 목적통합·정제된 반복 분석과 보고다양한 원본의 유연한 보존·탐색레이크의 유연성과 관리된 분석 기능의 결합
데이터 구조정의된 모델과 품질 기준을 먼저 적용하는 경향저장 후 활용 목적에 맞게 구조를 해석하는 경향개방형 저장 위에 스키마·트랜잭션·관리 기능 강화
주요 사용자정형 보고, BI, 반복 질의 사용자탐색·가공·모형 개발 사용자BI와 데이터 과학을 함께 지원하려는 조직
핵심 위험모델 변경 비용, 원본 다양성 수용 한계메타데이터·품질·소유자 부재 시 데이터 늪운영 복잡성, 제품 기능에 대한 과도한 기대

스키마를 먼저 적용한다읽을 때 해석한다는 상대적 경향이지 절대 규칙은 아니다. 현대 플랫폼은 여러 방식을 혼합한다. 시험에서는 제품명이 아니라 반복 보고, 원본 보존, 탐색 유연성, 거버넌스 등 선택 조건을 본다.

데이터레이크도 메타데이터, 카탈로그, 소유자, 품질 수준, 접근 정책이 필요하다. 원본 형식으로 저장했다는 이유로 의미와 품질이 자동으로 보장되지는 않는다.

4. 횡단 관리와 비기능 요구사항

요구사항판단 질문혼동하면 안 되는 개념
확장성데이터·작업·사용자가 늘 때 자원을 확장할 수 있는가?장애 중 서비스를 유지하는 가용성과 다르다.
가용성일부 구성요소가 실패해도 필요한 서비스를 유지하는가?저장 데이터가 보존되는 내구성과 다르다.
일관성업무가 요구하는 기준에서 최신·동일한 값을 제공하는가?모든 시스템이 항상 즉시 같은 값을 보여야 한다는 뜻은 아니다.
내구성저장 완료된 데이터가 장애 뒤에도 복구·보존되는가?서비스가 중단되지 않는 가용성과 다르다.
관찰 가능성지연·오류·처리량·비용·품질 원인을 추적할 수 있는가?단순히 서버가 켜져 있는지만 보는 것이 아니다.
거버넌스소유자·메타데이터·권한·보존·감사 기록을 관리하는가?문서 작성만으로 끝나는 활동이 아니다.

기능이 동작해도 요구한 시간 안에 결과가 나오지 않거나 장애 복구가 불가능하면 플랫폼은 목적을 달성하지 못한다. 성능·품질·비용·보안을 함께 모니터링해야 한다.

5. 요구사항에서 기술 선택까지

플랫폼 설계는 다음 순서로 접근한다.

  1. 사용자와 의사결정 정의: 누가 어떤 결과를 어디에 사용하는지 정한다.
  2. 지연시간·품질 기준 정의: 결과가 필요한 시점, 허용 오류, 기준 시점을 정한다.
  3. 데이터 원천 확인: 형식, 양, 유입 속도, 권한, 품질, 변경 가능성을 확인한다.
  4. 데이터 흐름과 복구 설계: 수집·저장·처리·제공 경로와 재처리 기준을 설계한다.
  5. 계층별 방식과 기술 선택: 배치·스트림, 저장 구조, 분산 처리 여부를 선택한다.
  6. 운영 지표와 책임 정의: 지연·누락·오류·비용·품질과 담당자를 정한다.

제품을 먼저 선정하면 요구사항을 제품 기능에 억지로 맞추기 쉽다. 기술 선정은 데이터 흐름과 운영 기준을 정의한 뒤 수행한다.

6. 사례 적용

상황: 온라인 서비스가 클릭 이벤트를 초당 수만 건 수집한다. 추천 화면은 최근 5분 행동을 반영해야 하고, 매출 정산은 다음 날 정확히 완료되어야 한다.

요구 분리

  • 추천: 짧은 지연시간, 최근 이벤트의 연속 집계가 중요하다.
  • 정산: 전체 범위의 완전성, 기준 시점, 재현성이 중요하다.

설계 판단

  • 수집 단계에서 이벤트 식별자, 중복, 늦은 도착, 누락을 관리한다.
  • 추천용 최근 행동은 이벤트 발생 시각 기준의 스트림 윈도우로 계산한다.
  • 원본 이벤트는 권한과 보존 기간을 적용해 저장한다.
  • 정산은 원본을 기준으로 배치 재계산하고 마감 기준 시점을 기록한다.
  • 스트림 임시 결과와 정산 확정 결과의 목적·정확성 수준을 구분한다.

결론: 배치와 스트림을 조합하는 구조가 적합하다. 추천용 임시 집계를 회계 정산의 유일한 근거로 사용하면 서로 다른 정확성·재현성 요구를 혼동하게 된다.

수집에서 저장, 처리, 분석, 제공으로 이어지는 다섯 계층과 모든 계층을 가로지르는 거버넌스, 보안, 관측성
수집에서 저장, 처리, 분석, 제공으로 이어지는 다섯 계층과 모든 계층을 가로지르는 거버넌스, 보안, 관측성

플랫폼은 제품 이름의 목록이 아니라 데이터가 수집·저장·처리·분석되어 제공되는 계층 구조다. 거버넌스·보안·메타데이터·품질·관측성은 어느 한 계층의 부속 기능이 아니라 전체 흐름을 가로지른다.

이벤트 발생 시각을 $t_e$, 플랫폼 도착 시각을 $t_a$, 결과 제공 시각을 $t_o$라 하면 대표 지연은 다음처럼 분리할 수 있다.

도착지연=t_a-t_e, 처리·제공지연=t_o-t_a
여러 이벤트를 정해진 창에서 한꺼번에 처리하는 배치와 이벤트 도착에 가깝게 연속 처리하는 스트림의 시간축 비교
여러 이벤트를 정해진 창에서 한꺼번에 처리하는 배치와 이벤트 도착에 가깝게 연속 처리하는 스트림의 시간축 비교

배치는 정해진 창의 데이터를 모아 처리하고 스트림은 이벤트 도착에 가깝게 연속 처리한다. 스트림에도 늦은 도착·순서 뒤바뀜·중복이 존재하므로 워터마크와 재처리 전략이 필요하다.

구분배치스트림
처리 단위시간·건수 창이벤트 또는 작은 마이크로배치
강점대량 정산·재처리·단순 운영낮은 지연의 경보·실시간 반응
핵심 위험창 종료까지 대기순서·중복·늦은 이벤트

시험 판단 포인트

  • 플랫폼은 수집·저장·처리·분석·제공 계층과 횡단 관리 기능의 결합이다.
  • 배치는 범위를 묶어 재계산하는 데, 스트림은 시간 민감한 이벤트를 연속 처리하는 데 상대적 강점이 있다.
  • 스트림에서는 중복·순서·지연 이벤트·상태·윈도우를 고려한다.
  • 데이터웨어하우스는 통합·정제된 반복 분석에, 데이터레이크는 다양한 원본의 유연한 보존·탐색에 상대적 강점이 있다.
  • 데이터레이크도 메타데이터·품질·소유자·접근 정책이 필요하다.
  • 분산 처리는 확장성을 높일 수 있지만 통신·조정·재분배·복구 비용이 생긴다.
  • 기술보다 사용자, 지연시간, 품질, 데이터 흐름, 복구와 운영 지표를 먼저 정의한다.

자주 틀리는 부분

  • 플랫폼을 특정 제품이나 저장 장치 하나와 같은 뜻으로 보지 않는다.
  • 데이터가 크다는 이유만으로 모든 계층을 분산화하지 않는다.
  • 스트림 결과가 배치 결과보다 언제나 정확하다고 보지 않는다.
  • 이벤트 발생 시각과 플랫폼 도착 시각을 같은 것으로 가정하지 않는다.
  • 데이터레이크는 스키마·품질·거버넌스가 필요 없다고 판단하지 않는다.
  • 확장성·가용성·일관성·내구성을 같은 개념으로 혼동하지 않는다.
스스로 확인하기

개념 확인 문제

문제를 누르면 바로 아래에서 정답과 해설을 확인할 수 있습니다.

01빅데이터 플랫폼에 관해 설명하시오.
정답 및 해설

수집·저장·처리·분석·제공과 품질·보안·운영을 연결하는 환경이다.

플랫폼은 데이터 원천에서 결과 활용까지의 계층과 메타데이터·품질·보안·운영 같은 횡단 관리 기능을 연결한다.

02배치 처리와 스트림 처리의 차이를 비교하여 설명하시오.
정답 및 해설

배치는 범위를 묶은 재계산에, 스트림은 저지연 연속 처리에 상대적 강점이 있다.

배치는 정해진 범위를 재실행·재계산하는 데 적합하고, 스트림은 계속 들어오는 이벤트를 짧은 지연으로 처리하는 데 적합하다. 스트림에서는 중복·순서·지연 이벤트·상태를, 배치에서는 기준 시점·재실행·전체 작업 상태를 관리해야 하며 두 방식은 혼합할 수 있다.

03데이터웨어하우스와 데이터레이크에 관해 올바르게 설명하시오.
정답 및 해설

웨어하우스는 통합된 반복 분석에, 레이크는 다양한 원본의 유연한 보존·탐색에 상대적 강점이 있다.

웨어하우스는 정의된 구조와 품질 기준을 적용한 반복 분석·보고에, 레이크는 다양한 원본의 유연한 보존과 탐색에 상대적 강점이 있다. 레이크에도 메타데이터·품질·권한이 필요하며, 현대 환경은 두 접근을 혼합할 수 있으므로 절대적인 데이터 형식이나 제품명만으로 구분하지 않는다.

04최근 5분 이상 거래 경보와 다음 날 정산을 함께 지원해야 한다. 적절한 설계를 서술하시오.
정답 및 해설

경보는 스트림으로 처리하고 정산은 원본 기반 배치 재계산으로 확정한다.

시간에 민감한 경보는 스트림 경로가 적합하고, 완전성과 재현성이 중요한 정산은 저장한 원본을 기준으로 배치 재계산해 확정하는 것이 타당하다. 서로 다른 목적의 결과를 같은 정확성 수준으로 취급하지 않는다.