Les étiquettes coûtent cher. Les données brutes sont bon marché. L'apprentissage semi-supervisé combine un petit ensemble d'étiquettes avec un grand ensemble de données non étiquetées, en utilisant la structure de ces dernières pour améliorer la généralisation au-delà de ce que les étiquettes seules permettraient.
Les approches varient. L'auto-apprentissage consiste à étiqueter des exemples non étiquetés à l'aide d'un modèle, puis à le réentraîner sur l'ensemble combiné. La régularisation de cohérence oblige le modèle à produire des sorties similaires pour des versions perturbées d'une même entrée. Les méthodes basées sur les graphes propagent les étiquettes à travers des réseaux de similarité.
Techniques semi-supervisées courantes
- Autoformation et pseudo-étiquetage
- Régularisation de la cohérence
- Minimisation de l'entropie
- Propagation d'étiquettes basée sur un graphe
- Pré-entraînement contrastif suivi d'un réglage fin
Les résultats dépendent fortement des données. Si les exemples non étiquetés proviennent d'une distribution différente de celle des exemples étiquetés, les performances peuvent se dégrader. Une validation rigoureuse et une adéquation au domaine sont tout aussi importantes que l'algorithme lui-même.
Comments
No comments yet. Be the first to share a thought.
Leave a comment