データセットとは、分析のために整理された関連データポイントの集合です。単一のテーブル、ファイルのセット、またはデータベースの抽出データなど、様々な形式があります。データセットにはそれぞれ目的があります。例えば、Irisデータセットには花びらと萼片の測定値が含まれており、分類学習に用いられます。MNISTデータセットには手書き数字が含まれており、画像認識のベンチマークに用いられます。企業の売上データセットには取引データが含まれており、収益予測に用いられます。データセットは分析の範囲を定義します。
データセットは、サイズ、品質、構造において大きく異なります。スプレッドシートで開けるほど小さいものもあれば、分散ストレージにペタバイト規模で保存されているものもあります。出所が文書化され、慎重にキュレーションされたものもあれば、信頼性が不明なままウェブから収集されたものもあります。データセットの品質は、それに基づいて構築される分析の品質を決定します。欠損値、偏ったサンプリング、または一貫性のないラベル付けを含むデータセットは、信頼性の低い結果を生み出します。データセットを使用する前に、それを検証してください。ソースは何ですか?どのように収集されましたか?期間は?何が欠落していますか?既知の制限は何ですか?これらの質問は省略できません。データがサポートできる範囲を決定します。ある分析に適したデータセットが、別の分析には適さない場合があります。データ自体には限界がありません。分析者は限界を知る必要があります。
データセットの特性
- サイズ — レコード数と機能数
- 構造 ― 表形式、階層形式、または非構造形式
- 品質 ― 正確性、完全性、一貫性
- 由来 — どこから来たのか、どのように
- ライセンス ― 利用条件および再配布条件
データセットとは、世界の一断面を切り取ったものである。その断面には枠組みが存在する。枠組みを理解することは、データを理解することの一部である。
Comments
No comments yet. Be the first to share a thought.
Leave a comment