Anonymizace dat odstraňuje osobní identifikátory, takže data nelze propojit s jednotlivci. Jména, adresy, telefonní čísla a čísla sociálního zabezpečení se odstraňují nebo nahrazují. Cílem je použít data pro výzkum nebo analýzu, aniž by byla odhalena identita kohokoli. Výzkumníci ve zdravotnictví anonymizují záznamy o pacientech. Společnosti anonymizují data o chování uživatelů před jejich sdílením s partnery.
Skutečná anonymizace je těžší, než se zdá. Odstranění jmen nestačí. Kombinace atributů mohou lidi znovu identifikovat. Datum narození, PSČ a pohlaví společně jednoznačně identifikují většinu osob ve Spojených státech. Latanya Sweeney to demonstrovala v roce 1997, když znovu identifikovala lékařské záznamy guvernéra státu z údajně anonymních dat. Datová sada Netflix Prize byla v roce 2008 deanonymizována křížovým odkazem s hodnocením IMDb. Techniky jako k-anonymita, diferenciální soukromí a generování syntetických dat se snaží tento problém vyřešit. Každá z nich má kompromisy mezi soukromím a užitečností. Silnější anonymizace znamená méně užitečná data. Dokonalá anonymizace může znamenat, že data nebudou k dispozici vůbec. Regulační orgány si tuto obtíž uvědomují. GDPR zachází s anonymizovanými daty odlišně od pseudonymizovaných dat, ale hranice mezi nimi je nejasná. Opakovaná identifikace je často jen otázkou úsilí.
Anonymizační techniky
- Potlačení – úplné odstranění identifikátorů
- Zobecnění – nahrazení konkrétních hodnot rozsahy
- Pseudonymizace — výměna identifikátorů za falešné, vratná pomocí klíče
- Diferenciální soukromí – přidání statistického šumu pro ochranu jednotlivců
- Syntetická data – generují umělé záznamy, které napodobují skutečné vzorce
Anonymizace snižuje riziko. Neodstraňuje ho. S anonymizovanými daty zacházejte opatrně.
Comments (3)
Leave a comment