Modellen leren van data, en data bevat geschiedenis. Train een wervingssysteem op basis van decennia aan beslissingen die één bepaalde groep bevoordeelden, en het systeem reproduceert dat patroon, vaak met meer zekerheid en minder inzicht dan een mens zou doen. Dat is algoritmische vooringenomenheid.
De bronnen zijn divers. Groepen die ondervertegenwoordigd zijn in de trainingsdata krijgen slechtere voorspellingen. Proxyvariabelen zoals postcode kunnen ras of klasse vervangen. Doelfuncties die optimaliseren voor de algehele nauwkeurigheid kunnen ten koste gaan van de prestaties bij minderheden.
Veelvoorkomende verschijningsvormen
- Foutpercentages bij gezichtsherkenning verschillen per huidskleur.
- Kredietscores die bepaalde buurten benadelen
- Aanbevelingssystemen die stereotypen versterken
- Medische modellen die zijn getraind op niet-representatieve populaties.
Oplossingen variëren van het herbalanceren van datasets tot het opleggen van eerlijkheidsbeperkingen tijdens de training en tot audits achteraf. Geen enkele oplossing is volledig, en definities van eerlijkheid kunnen wiskundig gezien met elkaar in conflict komen. De keuze voor een bepaalde definitie is een beleidsbeslissing, geen technische.
Comments
No comments yet. Be the first to share a thought.
Leave a comment