EN - FR - DE - ES - IT - PT -

LexiconDream

🕵️ Adversariales Beispiel

Eine Eingabe, die so gestaltet ist, dass ein Modell sie falsch einordnet.

Adversariales Beispiel

Verändert man ein paar Pixel in einem Bild, erkennt ein Klassifikator etwas völlig anderes. Fügt man einem Stoppschild unmerkliches Rauschen hinzu, interpretiert ein autonomes Fahrsystem es möglicherweise als Geschwindigkeitsbegrenzung. Diese manipulierten Eingaben sind sogenannte Adversarial Examples und verdeutlichen, wie unterschiedlich Maschinen und Menschen die Welt wahrnehmen.

Forscher erzeugen sie, indem sie den Gradienten der Verlustfunktion des Modells in Bezug auf die Eingabe berechnen und die Eingabe anschließend in die Richtung verschieben, die den Fehler maximiert. Die Änderung ist oft mit bloßem Auge nicht sichtbar. Die schnelle Gradientensignaturmethode und der projizierte Gradientenabstieg sind zwei gängige Verfahren.

Warum sie wichtig sind

Es gibt zwar Verteidigungsmechanismen, darunter Gegnertraining und Eingabebereinigung, aber keiner ist vollkommen zuverlässig. Jede neue Verteidigungsmaßnahme wird in der Regel durch einen neuen Angriff überwunden, wodurch sich das Feld ständig weiterentwickelt.

Comments (3)

  1. Dr. Paul S.
    Adversarial examples show how fragile machine learning models can be. Tiny changes to an image can fool a classifier completely.
  2. Tina R.
    The security implications are huge. If a self driving car can be fooled by a modified stop sign that's a serious problem.
  3. Ken F.
    This is one of those AI concepts that sounds abstract until you realize it's a real vulnerability.

Leave a comment