どのモデルも、入力されたデータの圧縮された反映である。トレーニングデータは、その入力データに相当する。つまり、機械学習システムが実際に何らかの有用な処理を行う前に学習する、一連の例の集まりである。顔認識モデルは、何百万枚ものラベル付き肖像写真から学習するかもしれない。チェスエンジンは何百万もの対局から学習する。医療分類器は、放射線科医によって注釈が付けられたスキャン画像から学習する。
ボリュームも重要ですが、構成の方がより重要です。ポートレートが白人男性に偏っている場合、モデルは肌の色が濃い女性には対応できません。ゲームデータがアマチュアプレイヤーからのものだけの場合、エンジンの性能は頭打ちになります。研究者たちはこれを分布の偏りと呼び、ラボでは素晴らしい性能を発揮するモデルが実環境でつまずく最も一般的な理由の一つです。
実務上の懸念
- ラベルの品質:ノイズや偏りのある注釈はモデルに悪影響を与える
- 同意とライセンス:ウェブスクレイピングされたデータには法的リスクが伴う可能性があります
- プライバシー:個人情報は多くの場合、削除または匿名化する必要がある
- 代表性:希少集団は意図的に過剰サンプリングする必要がある
機械学習プロジェクトにおいて、データのクリーニングとキュレーションは通常、プロジェクト全体の時間の60~80%を占める。華やかな部分はアーキテクチャ設計だが、決定的な部分はデータセットである。
Comments
No comments yet. Be the first to share a thought.
Leave a comment