Spam ou non. Malfaisant ou bénin. Fraude ou légitime. La classification attribue les données d'entrée à l'une des catégories prédéfinies et sous-tend une part importante de l'apprentissage automatique pratique.
Les modèles apprennent une frontière de décision à partir d'exemples étiquetés. La classification binaire sépare deux classes. La classification multiclasse s'étend à plusieurs classes. La classification multilabel permet d'attribuer plusieurs étiquettes simultanément, ce qui est utile lorsque les catégories ne sont pas mutuellement exclusives.
classificateurs courants
- Régression logistique
- arbres de décision et forêts aléatoires
- Machines à vecteurs de support
- Réseaux neuronaux
- Bayes naïf
La précision seule est un indicateur peu fiable lorsque les classes sont déséquilibrées. Un détecteur de fraude qui ne signale aucune infraction peut atteindre une précision de 99,9 % sur un jeu de données où la fraude est rare, mais il est inutile. La précision, le rappel et le score F1 offrent une vision plus réaliste.
Comments
No comments yet. Be the first to share a thought.
Leave a comment