Zmieniając kilka pikseli na obrazie, klasyfikator dostrzega coś zupełnie innego. Dodaj niezauważalny szum do znaku stop, a system autonomicznej jazdy może go odczytać jako ograniczenie prędkości. Te spreparowane dane wejściowe to przykłady antagonistyczne, które ujawniają, jak odmiennie maszyny i ludzie postrzegają świat.
Naukowcy generują je, obliczając gradient straty modelu względem danych wejściowych, a następnie przesuwając dane wejściowe w kierunku maksymalizującym błąd. Zmiana ta jest często niewidoczna gołym okiem. Metoda szybkiego znaku gradientu i rzutowany spadek gradientu to dwie popularne techniki.
Dlaczego są ważne
- Systemy bezpieczeństwa można celowo oszukać
- Pojazdy autonomiczne mogą błędnie odczytywać znaki
- Modelami obrazowania medycznego można manipulować
- Systemy głosowe można atakować za pomocą ukrytego dźwięku
Istnieją mechanizmy obronne, w tym treningi adwersarzy i oczyszczanie danych wejściowych, ale żaden z nich nie jest w pełni niezawodny. Każda nowa obrona zazwyczaj zostaje przełamana przez nowy atak, co utrzymuje pole bitwy w ruchu.
Comments (3)
Leave a comment