Verander een paar pixels in een afbeelding en een classificator ziet iets totaal anders. Voeg onmerkbare ruis toe aan een stopbord en een zelfrijdend systeem kan het interpreteren als een snelheidslimiet. Deze gemanipuleerde invoer is een voorbeeld van een conflictsituatie en laat zien hoe verschillend machines en mensen de wereld waarnemen.
Onderzoekers genereren ze door de gradiënt van het verlies van het model ten opzichte van de invoer te berekenen en vervolgens de invoer bij te sturen in de richting die de fout maximaliseert. De verandering is vaak onzichtbaar voor het blote oog. De Fast Gradient Sign Method en Projected Gradient Descent zijn twee veelgebruikte technieken.
Waarom ze belangrijk zijn
- Beveiligingssystemen kunnen opzettelijk worden misleid.
- Autonome voertuigen kunnen verkeersborden verkeerd interpreteren.
- Medische beeldvormingsmodellen kunnen worden gemanipuleerd.
- Spraaksystemen kunnen worden aangevallen met verborgen audio.
Er bestaan verdedigingsmechanismen, zoals vijandige training en het zuiveren van input, maar geen enkele is volledig betrouwbaar. Elke nieuwe verdediging wordt doorgaans door een nieuwe aanval doorbroken, waardoor het spel constant in beweging blijft.
Comments (3)
Leave a comment