データ品質とは、データが本来の用途にどれだけ適しているかを測る指標です。正確性、完全性、一貫性、適時性、妥当性などが求められます。不良データには様々な種類があります。欠損値、重複レコード、日付の形式間違い、存在しない住所などです。それぞれの欠陥にはコストがかかります。マーケティングキャンペーンでは、無効な住所にメールが送られてしまいます。財務報告書では、重複データのために収益が過大計上されてしまいます。機械学習モデルでは、トレーニングデータが不完全だったために、偏った予測をしてしまうことがあります。
データ品質は一度解決すれば良いものではありません。継続的な取り組みが必要です。各データセットごとに品質の基準を定義し、定期的に測定してください。許容できる品質のしきい値を設定し、数値が低下した場合は調査してください。根本原因は通常、技術的な問題ではなく、プロセス上の問題です。検証なしのデータ入力はエラーを生み出します。共通の顧客IDを共有しないシステムは重複データを作成します。不完全なレコードを許容するプロセスは欠落を生み出します。プロセスを修正すればエラーは発生しません。プロセスを修正せずにデータを修正しても、エラーは再発します。データ品質ツールは、プロファイリング、クレンジング、監視に役立ちますが、所有権を代替するものではありません。各データセットには責任者が必要です。その責任がなければ、品質は低下します。品質は常に低下するものです。
データ品質の次元
- 正確性 ― データは現実を反映している
- 完全性 ― 欠損値がない
- 一貫性 ― システム間で同じデータを使用する
- 適時性 — データは最新である
- 妥当性 ― データがルールに準拠していること
- 独自性 ― 重複なし
データ品質は全員の責任である。誰も責任を負わない場合、データ品質は低下する。
Comments
No comments yet. Be the first to share a thought.
Leave a comment