Les modèles ne perçoivent pas la réalité brute. Ils identifient des caractéristiques, des propriétés mesurables extraites des données et intégrées à un algorithme d'apprentissage. Une maison devient ainsi une surface habitable, un nombre de chambres, son âge et sa localisation. Un document devient un nombre de mots ou un vecteur de représentation.
L'ingénierie des caractéristiques a longtemps dominé l'apprentissage automatique appliqué. Les praticiens concevaient manuellement des ratios, des transformations logarithmiques et des termes d'interaction pour aider les modèles à identifier des schémas. L'apprentissage profond a bouleversé cette approche, permettant aux réseaux d'apprendre les caractéristiques directement à partir des données brutes.
types de caractéristiques communes
- Des valeurs numériques comme le prix ou la température
- Étiquettes catégorielles encodées sous forme de nombres
- Texte converti en comptages ou en vecteurs
- pixels d'image ou représentations apprises
- Rapports et interactions dérivés
Les caractéristiques pertinentes sont porteuses de sens. Les caractéristiques redondantes ou bruitées ralentissent l'apprentissage et nuisent à la généralisation. La sélection et l'extraction de caractéristiques restent importantes, notamment sur les petits ensembles de données où l'apprentissage profond présente peu d'avantages.
Comments
No comments yet. Be the first to share a thought.
Leave a comment