Ändra några pixlar i en bild och en klassificerare ser något helt annat. Lägg till omärkbart brus till en stoppskylt och ett självkörande system kan läsa det som en hastighetsgräns. Dessa skapade indata är exempel på motstridiga händelser och de visar hur olika maskiner och människor uppfattar världen.
Forskare genererar dem genom att beräkna gradienten för modellens förlust i förhållande till ingången, och sedan knuffa ingången i den riktning som maximerar felet. Förändringen är ofta osynlig för ögat. Snabbgradientteckenmetod och projekterad gradientnedgång är två vanliga tekniker.
Varför de spelar roll
- Säkerhetssystem kan luras avsiktligt
- Autonoma fordon kan misstolka skyltar
- Medicinska avbildningsmodeller kan manipuleras
- Talsystem kan attackeras med dolt ljud
Försvar finns, inklusive träning av fiender och sanering av input, men inget är helt tillförlitligt. Varje nytt försvar tenderar att brytas ner av en ny attack, vilket håller planen i rörelse.
Comments (3)
Leave a comment