Измените несколько пикселей на изображении, и классификатор увидит совершенно другое. Добавьте едва заметный шум к знаку «Стоп», и система автономного вождения может воспринять его как ограничение скорости. Эти специально созданные входные данные являются примерами противодействия и демонстрируют, насколько по-разному машины и люди воспринимают мир.
Исследователи создают их, вычисляя градиент функции потерь модели относительно входных данных, а затем корректируя входные данные в направлении, максимизирующем ошибку. Изменение часто незаметно для глаза. Быстродействующий метод градиентного спуска и проекционный градиентный спуск — две распространенные методики.
Почему они важны
- Системы безопасности можно обмануть преднамеренно.
- Автономные транспортные средства могут неправильно считывать знаки.
- Модели медицинских изображений можно подвергать манипуляциям.
- Системы распознавания речи могут быть атакованы с помощью скрытых аудиоданных.
Существуют различные средства защиты, включая обучение с использованием состязательных методов и проверку входных данных, но ни одно из них не является полностью надежным. Каждая новая защита, как правило, преодолевается новой атакой, что поддерживает постоянный поток информации.
Comments (3)
Leave a comment