ラベルは高価ですが、生データは安価です。半教師あり学習は、少量のラベル付きデータセットと大量のラベルなしデータセットを組み合わせ、ラベルなしデータの構造を利用して、ラベルのみでは達成できない汎化性能を向上させます。
アプローチは様々である。自己学習では、ラベル付けされていないサンプルにモデルでラベルを付け、その後、結合されたデータセットで再学習を行う。一貫性正則化では、モデルが同じ入力の摂動バージョンに対して同様の出力を生成するように強制する。グラフベースの手法では、類似性ネットワークを通じてラベルを伝播させる。
一般的な半教師あり学習手法
- 自己学習と擬似ラベル付け
- 一貫性正則化
- エントロピー最小化
- グラフベースのラベル伝播
- 対照的な事前学習とその後の微調整
結果はデータに大きく左右されます。ラベルなしのサンプルがラベル付きのサンプルとは異なる分布から得られた場合、パフォーマンスが低下する可能性があります。アルゴリズムと同様に、慎重な検証とドメインマッチングが重要です。
Comments
No comments yet. Be the first to share a thought.
Leave a comment