Personne n'indique à un enfant à quelle langue appartiennent les sons avant qu'il ne commence à les trier. L'apprentissage non supervisé fonctionne de la même manière : l'algorithme reçoit des données sans étiquettes et doit en découvrir la structure par lui-même. Il n'existe pas de réponse correcte à vérifier, seulement des régularités qui émergent de la structure même des données.
Le clustering en est l'exemple classique. Un détaillant pourrait soumettre une année d'historique d'achats à un algorithme de clustering et découvrir cinq groupes de clients distincts qu'il n'avait jamais identifiés. La réduction de dimensionnalité en est un autre exemple : elle consiste à compresser des centaines de mesures en une carte bidimensionnelle qui préserve les relations significatives.
Là où elle gagne sa vie
- Segmentation client pour le marketing
- Détection d'anomalies dans le trafic réseau ou la production
- Découverte de sujets dans de vastes collections de documents
- Représentations de pré-entraînement pour les tâches supervisées ultérieures
L'absence d'étiquetage présente à la fois des avantages et des inconvénients. Sans données de référence, l'évaluation des résultats est subjective et nécessite souvent une intervention humaine pour déterminer la pertinence des regroupements. Cependant, lorsque l'étiquetage est impossible ou trop coûteux, les méthodes non supervisées restent le seul moyen de révéler ce que les données dissimulent.
Comments (2)
Leave a comment