Il suffit de modifier quelques pixels dans une image pour qu'un classificateur interprète cela complètement différemment. De même, l'ajout d'un bruit imperceptible à un panneau stop peut amener un système de conduite autonome à le prendre pour une limitation de vitesse. Ces exemples d'entrée artificiellement créés constituent des exemples contradictoires et illustrent les différences de perception du monde entre les machines et les humains.
Les chercheurs les génèrent en calculant le gradient de la fonction de perte du modèle par rapport à l'entrée, puis en modifiant légèrement l'entrée dans la direction qui maximise l'erreur. Ce changement est souvent imperceptible à l'œil nu. La méthode du signe du gradient rapide et la descente de gradient projetée sont deux techniques courantes.
Pourquoi elles sont importantes
- Les systèmes de sécurité peuvent être trompés délibérément.
- Les véhicules autonomes peuvent mal interpréter les panneaux de signalisation.
- Les modèles d'imagerie médicale peuvent être manipulés
- Les systèmes vocaux peuvent être attaqués avec de l'audio caché
Des systèmes de défense existent, comme l'entraînement adverse et la désinfection des données d'entrée, mais aucun n'est totalement fiable. Chaque nouvelle défense est généralement contournée par une nouvelle attaque, ce qui maintient le terrain en constante évolution.
Comments (3)
Leave a comment