機械学習モデルは、トレーニングデータによって学習します。モデルは例を見て、入力と出力の関係性を学習します。スパムフィルターの場合、トレーニングデータはスパムかそうでないかがラベル付けされたメールです。画像分類器の場合は、内容がラベル付けされた写真です。言語モデルの場合は、膨大な量のテキストです。モデルは、予測と正しいラベルとの差を最小限に抑えるように内部パラメータを調整します。トレーニングデータの質と量が、モデルの性能を左右します。
トレーニングデータにはいくつかの要件があります。モデルが遭遇する現実世界のデータを代表するものでなければなりません。昼間の写真だけでトレーニングされたモデルは、夜間の写真では機能しません。正確にラベル付けされている必要があります。ラベルが間違っている例は、モデルに誤ったパターンを学習させます。データの変動を捉えるのに十分な大きさでなければなりません。データが少なすぎると過学習につながり、モデルは一般的なパターンを学習する代わりにトレーニング例を記憶してしまいます。バイアスがないものでなければなりません。そうでなければ、モデルはそのバイアスを学習して増幅します。トレーニングデータはプライバシーの問題でもあります。個人データでトレーニングされたモデルは、それを記憶して再現する可能性があります。規制の枠組みでは、トレーニングデータのソースと処理の文書化がますます求められています。データは単なる入力ではありません。負債であり資産でもあります。モデルの性能は、学習に使用したデータの性能に左右されます。
トレーニングデータの要件
- 代表的 — 現実世界のばらつきを反映している
- ラベル付き — 正確な正解データ
- 十分な例数で一般化できる
- 偏りがない ― 体系的な歪みがない
- 文書化済み — 出所と処理方法が判明している
訓練データは教師である。モデルはデータが示す内容を学習する。質の悪いデータは質の悪い教訓を教える。
Comments
No comments yet. Be the first to share a thought.
Leave a comment