데이터 중복이란 동일한 데이터가 두 개 이상의 위치에 존재하는 것을 의미합니다. 때로는 의도적인 경우도 있습니다. 백업은 설계상 중복성을 갖습니다. 복제된 데이터베이스는 가용성을 위해 여러 지역에 복사본을 보관합니다. RAID 어레이는 디스크 전체에 데이터를 복제하여 단일 디스크 장애가 발생하더라도 데이터 손실을 방지합니다. 의도적인 중복은 장애에 대비한 보호 장치이지만, 의도치 않은 중복은 문제를 야기합니다.
동일한 고객 정보가 동기화되지 않은 세 개의 시스템에 저장되면 정보가 서로 어긋나게 됩니다. 어떤 시스템에는 최신 주소가 있고, 다른 시스템에는 예전 전화번호가 있으며, 또 다른 시스템에는 이메일 주소에 오타가 있습니다. 어느 정보가 정확한지 아무도 알 수 없습니다. 서로 다른 시스템의 보고서 내용이 일치하지 않고, 분석가들은 이를 조정하는 데 많은 시간을 허비합니다. 이러한 문제를 해결하는 방법은 시스템 통합 또는 단일 정보 소스 구축입니다. 마스터 데이터 관리(MDM)는 각 엔티티에 대한 기준이 되는 시스템을 식별하고, 시스템 통합은 복사본들을 동기화 상태로 유지합니다. 두 가지 모두 비용과 노력이 필요합니다. 중복 자체가 항상 나쁜 것은 아닙니다. 중요한 것은 중복이 통제되는지 여부입니다. 통제된 중복은 신뢰성을 향상시키지만, 통제되지 않은 중복은 불일치를 초래합니다. 중복의 존재 여부보다 이러한 통제 방식이 훨씬 중요합니다. 중복이 없는 시스템은 취약하고, 무질서한 중복은 신뢰할 수 없습니다. 궁극적인 목표는 목적에 부합하는 의도적이고 관리된 중복을 구축하는 것입니다.
중복 유형
- 의도적 — 백업, 복제, RAID
- 의도치 않은 오류 - 중복 기록, 동기화되지 않은 시스템
- 제어됨 - 통합 또는 마스터 데이터를 통해 관리됨
- 통제되지 않으면 복사본들이 이리저리 움직이고 서로 일치하지 않습니다.
중복성은 도구입니다. 잘 사용하면 데이터를 보호하지만, 잘못 사용하면 신뢰를 무너뜨립니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment