모델은 데이터를 통해 학습하고, 데이터에는 역사가 담겨 있습니다. 특정 집단에 유리했던 수십 년간의 채용 결정 데이터를 기반으로 채용 시스템을 학습시키면, 시스템은 그 패턴을 그대로 재현하게 되는데, 종종 인간보다 더 확신을 갖고, 그 패턴이 드러나지 않게 됩니다. 이것이 바로 알고리즘 편향입니다.
데이터 출처는 다양합니다. 훈련 데이터에서 소수 집단이 대표될 경우 예측 정확도가 떨어집니다. 우편번호와 같은 대리 변수는 인종이나 계층을 대신할 수 있습니다. 전반적인 정확도를 최적화하는 목적 함수는 소수 집단에 대한 성능을 희생할 수 있습니다.
일반적인 증상
- 피부색에 따른 얼굴 인식 오류율 차이
- 신용평가기관이 특정 지역에 불이익을 주는 사례가 늘고 있다.
- 고정관념을 증폭시키는 추천 시스템
- 대표성이 없는 인구 집단을 기반으로 훈련된 의료 모델
개선 방안은 데이터셋 재균형 조정부터 학습 과정 중 공정성 제약 조건 적용, 사후 검증에 이르기까지 다양합니다. 하지만 어느 방안도 완벽하지 않으며, 공정성에 대한 정의는 수학적으로 상충될 수 있습니다. 따라서 어떤 정의를 사용할지는 기술적인 문제가 아니라 정책적인 문제입니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment