데이터 품질은 데이터가 의도된 용도에 얼마나 적합한지를 측정하는 척도입니다. 정확성, 완전성, 일관성, 시의성, 유효성 등이 중요합니다. 불량 데이터는 다양한 형태로 나타납니다. 누락된 값, 중복된 레코드, 잘못된 형식의 날짜, 존재하지 않는 주소 등이 그 예입니다. 이러한 결함 하나하나가 비용 손실로 이어집니다. 마케팅 캠페인에서 사용되지 않는 주소로 우편물을 발송하거나, 중복 데이터로 인해 재무 보고서의 매출이 과대 계상되거나, 불완전한 학습 데이터로 인해 머신러닝 모델이 편향된 예측을 하는 경우가 발생할 수 있습니다.
데이터 품질은 일회성 해결책이 아닙니다. 지속적인 관리가 필요한 실천적인 접근 방식입니다. 각 데이터 세트에 대한 품질 기준을 정의하고, 정기적으로 측정하며, 허용 가능한 품질 임계값을 설정해야 합니다. 수치가 떨어지면 원인을 조사해야 합니다. 근본적인 원인은 대개 기술적인 문제가 아니라 프로세스 문제입니다. 유효성 검사 없이 데이터를 입력하면 오류가 발생하고, 공통 고객 ID를 사용하지 않는 시스템은 중복 데이터를 생성하며, 불완전한 기록을 허용하는 프로세스는 데이터 누락을 초래합니다. 프로세스를 개선하면 오류를 예방할 수 있지만, 프로세스를 개선하지 않고 데이터만 수정하면 오류가 다시 발생합니다. 데이터 품질 도구는 프로파일링, 데이터 정제 및 모니터링에 도움이 되지만, 데이터 관리 책임을 대체할 수는 없습니다. 각 데이터 세트에 대한 책임자가 있어야 합니다. 책임자가 없으면 데이터 품질은 항상 저하됩니다.
데이터 품질 차원
- 정확성 — 데이터는 현실을 반영합니다
- 완전성 — 누락된 값이 없음
- 일관성 — 시스템 간 동일한 데이터
- 최신성 — 데이터는 최신입니다.
- 유효성 — 데이터가 규칙을 준수하는지 여부
- 독창성 — 중복 없음
데이터 품질은 모두의 책임입니다. 아무도 책임지지 않을 때, 데이터 품질은 실패합니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment