Modificar unos pocos píxeles en una imagen puede hacer que un clasificador la interprete de forma totalmente distinta. Si se añade ruido imperceptible a una señal de stop, un sistema de conducción autónoma podría interpretarla como un límite de velocidad. Estos ejemplos de datos manipulados son ejemplos de confrontación y ponen de manifiesto las diferencias en la percepción del mundo entre máquinas y humanos.
Los investigadores las generan calculando el gradiente de la función de pérdida del modelo con respecto a la entrada, y luego ajustando la entrada en la dirección que maximiza el error. El cambio suele ser imperceptible a simple vista. El método de signo de gradiente rápido y el descenso de gradiente proyectado son dos técnicas comunes.
Por qué son importantes
- Los sistemas de seguridad pueden ser engañados deliberadamente.
- Los vehículos autónomos pueden interpretar erróneamente las señales.
- Los modelos de imágenes médicas pueden ser manipulados.
- Los sistemas de voz pueden ser atacados con audio oculto.
Existen mecanismos de defensa, como el entrenamiento adversario y la depuración de datos, pero ninguno es totalmente fiable. Cada nueva defensa tiende a ser superada por un nuevo ataque, lo que mantiene el campo en constante evolución.
Comments (3)
Leave a comment