画像内の数ピクセルを変更するだけで、分類器は全く別のものを認識する。一時停止標識にほとんど知覚できないノイズを加えるだけで、自動運転システムはそれを速度制限標識と認識してしまうかもしれない。こうした意図的に操作された入力は敵対的サンプルと呼ばれ、機械と人間が世界をいかに異なって認識しているかを明らかにする。
研究者たちは、入力に対するモデルの損失の勾配を計算し、誤差が最大になる方向に入力を微調整することで、これらの変化を生み出します。この変化は多くの場合、目に見えません。高速勾配符号法と射影勾配降下法は、よく用いられる2つの手法です。
なぜそれらが重要なのか
- セキュリティシステムは意図的に騙される可能性がある
- 自動運転車は標識を誤読する可能性がある
- 医用画像モデルは操作可能
- 音声システムは、隠された音声によって攻撃される可能性がある。
敵対的学習や入力データのサニタイズなど、防御策は存在するが、どれも完全に信頼できるものではない。新たな防御策は新たな攻撃によって突破される傾向があり、そのため状況は常に変化し続けている。
Comments (3)
Leave a comment