이미지에서 몇 개의 픽셀만 바꿔도 분류기는 전혀 다른 것을 인식합니다. 정지 표지판에 미세한 노이즈를 추가하면 자율주행 시스템은 이를 속도 제한으로 인식할 수도 있습니다. 이렇게 인위적으로 만들어낸 입력값들을 적대적 예제라고 하며, 이를 통해 기계와 인간이 세상을 얼마나 다르게 인식하는지 알 수 있습니다.
연구자들은 모델의 손실 함수의 입력값에 대한 기울기를 계산한 다음, 오류를 최대화하는 방향으로 입력값을 미세 조정하여 이러한 기울기를 생성합니다. 이러한 변화는 종종 육안으로 구별하기 어렵습니다. 고속 경사 부호 방법(Fast Gradient Sign Method)과 투영 경사 하강법(Projected Gradient Descent)은 두 가지 일반적인 기법입니다.
왜 중요한가
- 보안 시스템은 의도적으로 속일 수 있습니다.
- 자율주행 차량은 표지판을 잘못 읽을 수 있습니다.
- 의료 영상 모델은 조작될 수 있습니다.
- 음성 시스템은 숨겨진 오디오를 이용해 공격받을 수 있습니다.
적대적 훈련 및 입력값 검증을 포함한 다양한 방어 수단이 존재하지만, 어느 것도 완전히 신뢰할 수 없습니다. 새로운 방어 수단이 등장할 때마다 새로운 공격에 의해 무력화되는 경향이 있어, 관련 기술 동향은 끊임없이 변화합니다.
Comments (3)
Leave a comment