データ収集は、さまざまな情報源から情報を収集します。アンケート、センサー、ウェブログ、取引記録、ソーシャルメディア、公開データベースなど、すべてがデータ収集プロセスに利用されます。収集方法によってデータは左右されます。誘導的な質問を含むアンケートは偏った回答を生み出し、校正のずれがあるセンサーは不正確な測定値を出力します。レート制限を無視するウェブスクレイパーはブロックされます。データ収集は中立ではありません。あらゆる選択が、得られる情報に影響を与えます。
まず最初に考えるべきは、何が必要で、なぜ必要なのかということです。あらゆるデータを収集したくなる気持ちは分かりますが、たいていは無駄になります。データの保存には費用がかかります。処理にも費用がかかります。データのクリーニングにも費用がかかります。使われずに放置されたデータは、資産ではなく負債です。次に考えるべきは、倫理的かつ合法的にデータを収集する方法です。同意は重要です。GDPRのようなプライバシー法では、個人データを収集するには法的根拠が必要です。多くのプラットフォームでは、利用規約によってスクレイピングが制限されています。最後に考えるべきは、データの品質です。情報源は信頼できるか?サンプルは代表的か?欠落はないか?品質管理なしに収集されたデータセットは、後々問題を引き起こす可能性があります。問題を発見する最良のタイミングは、データがパイプラインに入る前であり、誰かがそのデータに基づいてモデルを構築した後ではありません。
収集方法
- アンケート調査 ― 構造化された質問であり、回答バイアスが生じやすい
- センサー — 自動化、連続、校正に敏感
- ウェブスクレイピング ― 公開データを抽出するが、法的制限が適用される
- トランザクションログ — ユーザーの動作を自動的に記録します
- 公的記録 ― 政府およびオープンデータソース
データ収集は設計上の決定事項です。何を収集するかによって、何が学べるかが決まります。何を収集しないかによって、何を知ることができないかが決まります。
Comments
No comments yet. Be the first to share a thought.
Leave a comment