Un modèle entraîné à reconnaître les chats et les chiens possède déjà des connaissances sur les contours, les textures et le pelage. L'apprentissage par transfert exploite cette propriété : au lieu de partir de poids aléatoires, on utilise un réseau ayant appris à partir d'un vaste ensemble de données, puis on l'affine sur un problème spécifique plus restreint. Les connaissances acquises lors de la première tâche sont ainsi transférées à la seconde.
Cette approche s'est généralisée en raison de la rareté des données étiquetées et du coût élevé de la puissance de calcul. Entraîner un modèle de vision à partir de zéro sur 5 000 images médicales donne rarement de bons résultats. En revanche, utiliser un réseau pré-entraîné sur ImageNet et réentraîner ses dernières couches est souvent efficace. Les premières couches détectent des caractéristiques génériques, tandis que les couches suivantes se spécialisent.
Stratégies communes
- Extraction de caractéristiques : figer les couches pré-entraînées et entraîner uniquement une nouvelle tête de classificateur
- Réglage fin : dégeler certaines ou toutes les couches et poursuivre l’entraînement avec un faible taux d’apprentissage
- Adaptation de domaine : adapter un modèle à une distribution de données différente, par exemple de données synthétiques à des données réelles.
Les grands modèles de langage ont permis d'aller encore plus loin. Un seul modèle pré-entraîné peut être adapté à la rédaction juridique, au codage médical ou au support client moyennant un entraînement supplémentaire modeste. Le problème réside dans le transfert négatif : si les tâches source et cible sont trop différentes, les poids pré-entraînés peuvent s'avérer contre-productifs.
Comments
No comments yet. Be the first to share a thought.
Leave a comment