影像中幾個像素的改變,就能讓分類器辨識出完全不同的內容。在停車標誌上添加難以察覺的噪聲,自動駕駛系統就可能將其解讀為限速標誌。這些精心設計的輸入是對抗樣本,它們揭示了機器和人類感知世界方式的巨大差異。
研究人員透過計算模型損失函數相對於輸入的梯度來產生這些梯度,然後調整輸入值,使其朝著誤差最大化的方向變化。這種變化通常肉眼難以察覺。快速梯度符號法和投影梯度下降法是兩種常用的技術。
它們為何重要
- 安全系統可以被故意欺騙
- 自動駕駛車輛可能會誤讀標誌
- 醫學影像模型可以被操控
- 語音系統可能遭受隱藏音訊攻擊。
雖然有對抗訓練和輸入過濾等防禦措施,但沒有一種是完全可靠的。每一種新的防禦措施往往都會被新的攻擊手段破解,這使得攻擊領域不斷變化。
Comments (3)
Leave a comment