Schimbați câțiva pixeli dintr-o imagine și un clasificator vede cu totul altceva. Adăugați zgomot imperceptibil la un indicator de stop și un sistem de conducere autonomă îl poate citi ca o limită de viteză. Aceste date de intrare create manual sunt exemple contradictorii și expun modul în care mașinile și oamenii percep lumea diferit.
Cercetătorii le generează calculând gradientul pierderii modelului în raport cu intrarea, apoi mutând intrarea în direcția care maximizează eroarea. Schimbarea este adesea invizibilă pentru ochi. Metoda semnului gradientului rapid și coborârea gradientului proiectat sunt două tehnici comune.
De ce contează
- Sistemele de securitate pot fi păcălite în mod deliberat
- Vehiculele autonome pot citi greșit indicatoarele
- Modelele de imagistică medicală pot fi manipulate
- Sistemele de vorbire pot fi atacate cu sunet ascuns
Există mecanisme de apărare, inclusiv antrenamentul adversarilor și igienizarea input-urilor, dar niciuna nu este pe deplin fiabilă. Fiecare nouă apărare tinde să fie spartă de un nou atac, ceea ce menține câmpul de luptă în mișcare.
Comments (3)
Leave a comment