Modely se učí z dat a data nesou historii. Pokud trénujete náborový systém na desetiletích rozhodnutí, která upřednostňovala jednu skupinu, systém tento vzorec reprodukuje, často s větší jistotou a menší viditelností, než by to udělal člověk. To je algoritmické zkreslení.
Zdroje jsou různé. Nedostatečně zastoupené skupiny v trénovacích datech mají horší predikce. Zástupné proměnné, jako je PSČ, mohou zastupovat rasu nebo třídu. Objektivní funkce, které optimalizují celkovou přesnost, mohou obětovat výkon u menšin.
Běžné projevy
- Míra chybovosti rozpoznávání obličeje se liší podle odstínu pleti
- Kreditní skóre penalizuje určité čtvrti
- Systémy doporučení zesilující stereotypy
- Lékařské modely trénované na nereprezentativních populacích
Opravy sahají od vyvážení datových sad přes omezení spravedlnosti během školení až po následné audity. Žádná z nich není úplná a definice spravedlnosti si mohou matematicky protiřečit. Výběr definice, kterou použít, je politickým rozhodnutím, nikoli technickým.
Comments
No comments yet. Be the first to share a thought.
Leave a comment