EN - FR - DE - ES - IT - PT -

LexiconDream

🕵️ 敵対的サンプル

機械学習モデルを騙して誤分類させるように作られた入力。

敵対的サンプル

画像内の数ピクセルを変更するだけで、分類器は全く別のものを認識する。一時停止標識にほとんど知覚できないノイズを加えるだけで、自動運転システムはそれを速度制限標識と認識してしまうかもしれない。こうした意図的に操作された入力は敵対的サンプルと呼ばれ、機械と人間が世界をいかに異なって認識しているかを明らかにする。

研究者たちは、入力に対するモデルの損失の勾配を計算し、誤差が最大になる方向に入力を微調整することで、これらの変化を生み出します。この変化は多くの場合、目に見えません。高速勾配符号法と射影勾配降下法は、よく用いられる2つの手法です。

なぜそれらが重要なのか

敵対的学習や入力データのサニタイズなど、防御策は存在するが、どれも完全に信頼できるものではない。新たな防御策は新たな攻撃によって突破される傾向があり、そのため状況は常に変化し続けている。

Comments (3)

  1. Dr. Paul S.
    Adversarial examples show how fragile machine learning models can be. Tiny changes to an image can fool a classifier completely.
  2. Tina R.
    The security implications are huge. If a self driving car can be fooled by a modified stop sign that's a serious problem.
  3. Ken F.
    This is one of those AI concepts that sounds abstract until you realize it's a real vulnerability.

Leave a comment