Bir görüntüdeki birkaç pikseli değiştirin ve bir sınıflandırıcı tamamen farklı bir şey görür. Bir dur işaretine algılanamaz bir gürültü ekleyin ve otonom bir sistem onu hız sınırı olarak okuyabilir. Bu özel olarak hazırlanmış girdiler, düşmanca örneklerdir ve makinelerin ve insanların dünyayı ne kadar farklı algıladığını ortaya koymaktadır.
Araştırmacılar, modelin girişe göre kayıp fonksiyonunun gradyanını hesaplayarak ve ardından hatayı en üst düzeye çıkaracak yönde girişi hafifçe değiştirerek bu hataları oluştururlar. Bu değişiklik genellikle gözle görülemez. Hızlı gradyan işareti yöntemi ve izdüşümlü gradyan inişi, yaygın olarak kullanılan iki tekniktir.
Neden önemliler?
- Güvenlik sistemleri kasıtlı olarak kandırılabilir.
- Otonom araçlar işaretleri yanlış okuyabilir.
- Tıbbi görüntüleme modelleri manipüle edilebilir.
- Konuşma sistemlerine gizli ses dosyalarıyla saldırı düzenlenebilir.
Düşmanca eğitim ve girdi temizleme gibi savunma mekanizmaları mevcut, ancak hiçbiri tamamen güvenilir değil. Her yeni savunma mekanizması yeni bir saldırıyla kırılmaya meyilli olduğundan, oyun alanı sürekli hareket halinde kalıyor.
Comments (3)
Leave a comment