Chaque modèle est une version condensée des données qui l'ont alimenté. Les données d'entraînement constituent ce « régime » : l'ensemble des exemples qu'un système d'apprentissage automatique étudie avant d'être mis à contribution. Un modèle de reconnaissance faciale peut apprendre à partir de millions de portraits annotés. Un moteur d'échecs apprend à partir de millions de parties. Un classificateur médical apprend à partir de scanners annotés par des radiologues.
Le volume est utile, mais la composition l'est encore plus. Si les portraits sont majoritairement blancs et masculins, le modèle aura des difficultés avec les peaux plus foncées et les femmes. Si les données de jeu proviennent uniquement de joueurs amateurs, le moteur atteindra un plateau. Les chercheurs appellent ce phénomène un décalage de distribution, et c'est l'une des raisons les plus fréquentes pour lesquelles un modèle performant en laboratoire échoue en situation réelle.
préoccupations pratiques
- Qualité des étiquettes : des annotations bruitées ou biaisées faussent le modèle
- Consentement et licences : les données collectées sur le Web peuvent comporter des risques juridiques
- Confidentialité : les informations personnelles doivent souvent être effacées ou anonymisées.
- Représentation : les groupes rares nécessitent un suréchantillonnage délibéré
Le nettoyage et l'organisation des données absorbent généralement entre 60 et 80 % du temps d'un projet d'apprentissage automatique. L'architecture est la partie la plus attrayante ; le jeu de données est la partie déterminante.
Comments
No comments yet. Be the first to share a thought.
Leave a comment