데이터 클리닝은 데이터에서 오류를 찾아 수정하는 작업입니다. 중복 데이터, 결측값, 일관성 없는 형식, 오타, 이상치 등을 찾아냅니다. 데이터 작업에서 가장 화려하지 않은 부분이며, 종종 가장 많은 시간을 소모하는 작업이기도 합니다. 분석가들은 업무 시간의 60~80%를 클리닝에 할애한다고 합니다. 나머지 시간은 분석에 사용됩니다. 하지만 클리닝은 선택 사항이 아닙니다. 불량 데이터는 잘못된 결과를 낳고, 불량 데이터로 학습된 모델은 잘못된 예측을 하며, 중복 데이터를 기반으로 작성된 보고서는 총계를 과장합니다.
이 작업은 체계적으로 진행됩니다. 데이터의 형태와 문제점을 파악하기 위해 데이터를 분석합니다. 날짜, 전화번호, 주소 등의 형식을 표준화합니다. 누락된 값은 레코드를 삭제하거나, 값을 대체하거나, 검토 대상으로 표시하는 방식으로 처리합니다. 정확한 일치 항목이 없을 경우 유사 일치 방식을 사용하여 중복 레코드를 제거합니다. 알려진 제약 조건에 따라 유효성을 검사합니다. 모든 변환 과정을 문서화하여 재현성을 확보합니다. 자동화 도구는 도움이 되지만, 판단력을 대체할 수는 없습니다. 모든 이상치를 제거하는 클리닝 스크립트가 정상적인 예외 사례를 삭제할 수도 있고, 중복 제거 알고리즘이 이름이 같은 두 명의 고객을 병합할 수도 있습니다. 클리닝은 데이터의 구조뿐 아니라 맥락까지 이해하는 것을 요구합니다. 목표는 완벽한 데이터가 아니라 목적에 맞는 데이터를 만드는 것입니다. 분석 방법에 따라 허용되는 데이터의 양이 다를 수 있습니다.
일반적인 데이터 정리 작업
- 중복 제거 — 중복된 레코드를 제거하거나 병합합니다.
- 표준화 — 날짜, 이름, 주소에 대한 일관된 형식
- 결측값 처리 - 대체, 제거 또는 표시
- 이상치 탐지 — 이상 현상을 식별하고 조사합니다.
- 유효성 검사 — 비즈니스 규칙 및 제약 조건과의 일치 여부 확인
데이터 정리는 유용한 분석을 위한 필수 조건입니다. 데이터 정리를 생략하면 분석 결과는 무의미해집니다. 제대로 정리하면 나머지는 훨씬 수월해집니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment