|

데이터 품질 6가지|정확성·완전성·일관성과 개선 절차

데이터 품질은 단순히 오류가 없는 상태가 아니라, 사용 목적에 맞게 정확하고 완전하며 일관되고 제때 제공되는 상태입니다. 시험에서는 품질 차원과 프로파일링·정제·표준화·거버넌스의 역할을 구분하는 문제가 자주 나옵니다.

데이터 품질의 핵심 차원

차원질문예시
정확성실제 값을 올바르게 나타내는가주소·금액이 원천 사실과 일치
완전성필수 값이 빠지지 않았는가필수 고객 ID 결측률
일관성시스템·테이블 간 모순이 없는가같은 코드가 같은 의미로 사용
유효성형식·범위·규칙을 만족하는가날짜 형식과 허용 범위
유일성중복 없이 식별되는가한 고객에 하나의 식별자
적시성필요한 시점에 최신인가재고 정보 갱신 지연

프로파일링과 클렌징의 차이

프로파일링은 분포·결측·중복·패턴·참조관계를 측정해 문제를 발견하는 활동입니다. 클렌징은 발견한 오류를 수정·표준화·중복 제거하는 실행입니다. 측정 없는 정제는 효과를 판단하기 어렵고, 정제 뒤에는 동일 규칙으로 다시 측정해야 합니다.

표준·메타데이터·거버넌스

데이터 표준은 명칭·도메인·코드·형식을 통일하고, 메타데이터는 데이터의 의미·출처·변환·소유자를 설명합니다. 데이터 거버넌스는 책임자, 정책, 의사결정, 모니터링 체계를 정합니다. 품질은 일회성 정제 프로젝트가 아니라 운영 책임과 변경 관리가 있는 반복 과정입니다.

품질 개선의 기본 순환

  1. 업무 목적과 중요 데이터 요소를 정합니다.
  2. 측정 규칙과 허용 기준을 정의합니다.
  3. 프로파일링으로 기준선을 측정합니다.
  4. 원인을 찾아 정제·프로세스 수정을 실행합니다.
  5. 재측정하고 책임자와 개선 이력을 남깁니다.

모형 정확도가 낮다고 바로 알고리즘만 바꾸지 말고, 입력 데이터의 완전성·대표성·레이블 품질을 먼저 점검해야 합니다. 전처리 순서가 필요하면 2·3과목 과락 방어 가이드에서 분석 흐름을 함께 복습하세요.

자주 묻는 질문

데이터 정확성과 완전성은 어떻게 다른가요?

정확성은 값이 실제 사실과 맞는지, 완전성은 필요한 값이 빠지지 않았는지를 봅니다. 모든 필드가 채워져 있어도 값이 틀리면 완전하지만 정확하지 않을 수 있습니다.

데이터 프로파일링과 클렌징의 차이는 무엇인가요?

프로파일링은 분포·결측·중복·패턴을 측정해 문제를 발견하는 활동이고, 클렌징은 발견한 오류를 수정·표준화·중복 제거하는 실행입니다. 정제 뒤에는 같은 규칙으로 다시 측정해야 합니다.

데이터 품질 관리는 한 번 정제하면 끝나나요?

아닙니다. 데이터와 업무 규칙은 계속 바뀌므로 중요 데이터 요소, 품질 기준, 책임자, 모니터링과 개선 이력을 포함한 반복 운영 체계가 필요합니다.


당신이 좋아할 만한 콘텐츠

by Google Adsense


관련 글 보기