Anonimizarea datelor elimină identificatorii personali, astfel încât datele să nu poată fi asociate cu indivizi. Numele, adresele, numerele de telefon și numerele de asigurări sociale sunt eliminate sau înlocuite. Scopul este de a utiliza datele pentru cercetare sau analiză fără a expune identitatea nimănui. Cercetătorii din domeniul sănătății anonimizează dosarele pacienților. Companiile anonimizează datele despre comportamentul utilizatorilor înainte de a le partaja cu partenerii.
Anonimizarea reală este mai dificilă decât pare. Eliminarea numelor nu este suficientă. Combinațiile de atribute pot reidentifica persoanele. Data nașterii, codul poștal și sexul identifică împreună în mod unic majoritatea indivizilor din Statele Unite. Latanya Sweeney a demonstrat acest lucru în 1997 prin reidentificarea dosarelor medicale ale unui guvernator de stat din date presupus anonime. Setul de date Netflix Prize a fost dezanonizat în 2008 prin referențiere încrucișată cu ratingurile IMDb. Tehnici precum k-anonimitatea, confidențialitatea diferențială și generarea de date sintetice încearcă să rezolve problema. Fiecare are compromisuri între confidențialitate și utilitate. O anonimizare mai puternică înseamnă date mai puțin utile. Anonimizarea perfectă poate însemna lipsa totală a datelor. Autoritățile de reglementare recunosc dificultatea. GDPR tratează datele anonimizate diferit de datele pseudonimizate, dar linia dintre ele este neclară. Reidentificarea este adesea doar o chestiune de efort.
Tehnici de anonimizare
- Suprimare — eliminați complet identificatorii
- Generalizare — înlocuirea valorilor specifice cu intervale
- Pseudonimizare — schimbul de identificatori cu unii falși, reversibil cu o cheie
- Confidențialitate diferențială — adăugați zgomot statistic pentru a proteja persoanele
- Date sintetice — generează înregistrări artificiale care imită modele reale
Anonimizarea reduce riscul. Nu îl elimină. Tratați datele anonimizate cu grijă.
Comments (3)
Leave a comment