Altere alguns pixéis numa imagem e um classificador verá algo completamente diferente. Adicione ruído impercetível a um sinal de stop e um sistema de condução autónoma poderá interpretá-lo como um limite de velocidade. Estas entradas manipuladas são exemplos adversários e revelam como as máquinas e os humanos percecionam o mundo de formas tão distintas.
Os investigadores geram estes erros calculando o gradiente da função de perda do modelo em relação à entrada e, em seguida, ajustando a entrada na direção que maximiza o erro. A mudança é geralmente impercetível a olho nu. O método do sinal do gradiente rápido e o método do gradiente descendente projetado são duas técnicas comuns.
Por que razão são importantes
- Os sistemas de segurança podem ser enganados deliberadamente.
- Os veículos autónomos podem interpretar mal as placas de sinalização.
- Os modelos de imagens médicas podem ser manipulados.
- Os sistemas de fala podem ser atacados com áudio oculto.
Existem defesas, incluindo treino adversarial e higienização de entrada, mas nenhuma é totalmente fiável. Cada nova defesa tende a ser quebrada por um novo ataque, o que mantém a área em constante evolução.
Comments (3)
Leave a comment