Změňte několik pixelů v obrázku a klasifikátor uvidí něco úplně jiného. Přidejte k značce stop nepostřehnutelný šum a systém pro autonomní řízení jej může přečíst jako rychlostní limit. Tyto vytvořené vstupy jsou příklady kontradiktornosti a odhalují, jak odlišně stroje a lidé vnímají svět.
Výzkumníci je generují výpočtem gradientu ztráty modelu vzhledem ke vstupu a následným posunutím vstupu ve směru, který maximalizuje chybu. Změna je často pro oko neviditelná. Metoda rychlého gradientu znaménka a projektovaný gradientní sestup jsou dvě běžné techniky.
Proč na nich záleží
- Bezpečnostní systémy lze úmyslně oklamat
- Autonomní vozidla mohou špatně číst značení
- Lékařské zobrazovací modely lze manipulovat
- Řečové systémy lze napadnout skrytým zvukem
Existují obrany, včetně tréninku protivníka a sanitizace vstupů, ale žádná z nich není zcela spolehlivá. Každá nová obrana má tendenci být prolomena novým útokem, což udržuje pole v pohybu.
Comments (3)
Leave a comment