モデルは生の現実を見るのではなく、データから抽出され学習アルゴリズムに入力される測定可能な特性、つまり特徴を見る。家は面積、寝室の数、築年数、場所といった情報に変換され、文書は単語数や埋め込み表現に変換される。
かつて、応用機械学習では特徴量エンジニアリングが主流だった。実践者は、モデルがパターンを見つけるのを助けるために、比率、対数変換、交互作用項などを手作業で作成していた。ディープラーニングはこの作業のあり方を変え、ネットワークが生の入力から直接特徴量を学習できるようになった。
一般的な機能タイプ
- 価格や温度などの数値
- 数値としてエンコードされたカテゴリラベル
- テキストをカウントまたはベクトルに変換
- 画像ピクセルまたは学習済み埋め込み
- 導出された比率と相互作用
優れた特徴量はシグナルを伝える。冗長な特徴量やノイズの多い特徴量は学習速度を低下させ、汎化性能を損なう。特徴量の選択と抽出は、特に深層学習のメリットが少ない小規模データセットにおいては依然として重要である。
Comments
No comments yet. Be the first to share a thought.
Leave a comment