Dataanonymisering fjerner personlige identifikatorer, så dataene ikke kan forbindes tilbage til enkeltpersoner. Navne, adresser, telefonnumre og CPR-numre fjernes eller erstattes. Målet er at bruge dataene til forskning eller analyse uden at afsløre nogens identitet. Sundhedsforskere anonymiserer patientjournaler. Virksomheder anonymiserer data om brugeradfærd, før de deler dem med partnere.
Ægte anonymisering er sværere, end det lyder. Det er ikke nok at fjerne navne. Kombinationer af attributter kan genidentificere personer. Fødselsdato, postnummer og køn identificerer tilsammen entydigt de fleste individer i USA. Latanya Sweeney demonstrerede dette i 1997 ved at genidentificere en statsguvernørs lægejournaler ud fra angiveligt anonyme data. Netflix Prize-datasættet blev afanonymiseret i 2008 ved krydsreferencer med IMDb-vurderinger. Teknikker som k-anonymitet, differentiel privatlivsbeskyttelse og syntetisk datagenerering forsøger at løse problemet. Hver af dem har afvejninger mellem privatliv og nytteværdi. Stærkere anonymisering betyder mindre nyttige data. Perfekt anonymisering kan betyde slet ingen data. Tilsynsmyndigheder anerkender vanskeligheden. GDPR behandler anonymiserede data forskelligt fra pseudonymiserede data, men linjen mellem dem er sløret. Genidentifikation er ofte bare et spørgsmål om indsats.
Anonymiseringsteknikker
- Undertrykkelse — fjern identifikatorer helt
- Generalisering — erstat specifikke værdier med intervaller
- Pseudonymisering — udskift identifikatorer med falske, reversible med en nøgle
- Differentiel privatliv — tilføj statistisk støj for at beskytte enkeltpersoner
- Syntetiske data — generer kunstige optegnelser, der efterligner virkelige mønstre
Anonymisering reducerer risikoen. Det eliminerer den ikke. Behandl anonymiserede data med forsigtighed.
Comments (3)
Leave a comment