標籤成本高昂,而原始資料成本低。半監督學習將少量已標註資料集與大量未標註資料集結合,利用未標註資料的結構來提升泛化能力,超越了僅使用標籤所能達到的水準。
方法多種多樣。自訓練模型先對未標註的樣本進行標註,然後再對組合後的樣本集進行重新訓練。一致性正則化迫使模型對同一輸入的不同擾動版本產生相似的輸出。基於圖的方法則透過相似性網路傳播標籤。
常用的半監督技術
- 自訓練和偽標籤
- 一致性正規化
- 熵最小化
- 基於圖的標籤傳播
- 對比預訓練後進行微調
結果很大程度取決於數據。如果未標記樣本與已標記樣本的分佈不同,效能可能會下降。仔細的驗證和領域匹配與演算法本身同樣重要。
Comments
No comments yet. Be the first to share a thought.
Leave a comment