Anonimizacja danych usuwa identyfikatory osobowe, dzięki czemu nie można ich powiązać z konkretnymi osobami. Imiona, nazwiska, adresy, numery telefonów i numery ubezpieczenia społecznego są usuwane lub zastępowane. Celem jest wykorzystanie danych do badań lub analiz bez ujawniania czyjejkolwiek tożsamości. Badacze zajmujący się opieką zdrowotną anonimizują dokumentację medyczną. Firmy anonimizują dane dotyczące zachowań użytkowników przed udostępnieniem ich partnerom.
Prawdziwa anonimizacja jest trudniejsza, niż się wydaje. Samo usunięcie imion i nazwisk nie wystarczy. Kombinacje atrybutów mogą ponownie identyfikować osoby. Data urodzenia, kod pocztowy i płeć razem jednoznacznie identyfikują większość osób w Stanach Zjednoczonych. Latanya Sweeney udowodniła to w 1997 roku, ponownie identyfikując dokumentację medyczną gubernatora stanu na podstawie rzekomo anonimowych danych. Zbiór danych Netflix Prize został zanonimizowany w 2008 roku poprzez porównanie z ocenami IMDb. Techniki takie jak k-anonimizacja, prywatność różnicowa i generowanie danych syntetycznych próbują rozwiązać ten problem. Każda z nich wiąże się z kompromisem między prywatnością a użytecznością. Silniejsza anonimizacja oznacza mniej użyteczne dane. Doskonała anonimizacja może oznaczać brak danych. Organy regulacyjne dostrzegają ten problem. RODO traktuje dane zanonimizowane inaczej niż dane pseudonimizowane, ale granica między nimi jest niewyraźna. Ponowna identyfikacja często jest jedynie kwestią wysiłku.
Techniki anonimizacji
- Tłumienie — całkowite usunięcie identyfikatorów
- Uogólnienie — zastąp konkretne wartości zakresami
- Pseudonimizacja — zamiana identyfikatorów na fałszywe, odwracalna za pomocą klucza
- Prywatność różnicowa — dodaj szum statystyczny, aby chronić jednostki
- Dane syntetyczne — generuj sztuczne rekordy, które imitują rzeczywiste wzorce
Anonimizacja zmniejsza ryzyko, ale go nie eliminuje. Traktuj zanonimizowane dane ostrożnie.
Comments (3)
Leave a comment