Dataanonymisering tar bort personliga identifierare så att informationen inte kan kopplas tillbaka till individer. Namn, adresser, telefonnummer och personnummer tas bort eller ersätts. Målet är att använda informationen för forskning eller analys utan att avslöja någons identitet. Sjukvårdsforskare anonymiserar patientjournaler. Företag anonymiserar användarbeteendedata innan de delar den med partners.
Sann anonymisering är svårare än det låter. Att ta bort namn räcker inte. Kombinationer av attribut kan omidentifiera personer. Födelsedatum, postnummer och kön identifierar tillsammans unikt de flesta individer i USA. Latanya Sweeney demonstrerade detta 1997 genom att omidentifiera en delstatsguvernörs medicinska journaler från förmodat anonyma data. Netflix Prize-datasetet avanonymiserades 2008 genom korsreferenser med IMDb-betyg. Tekniker som k-anonymitet, differentiell integritet och syntetisk datagenerering försöker lösa problemet. Var och en har avvägningar mellan integritet och nytta. Starkare anonymisering innebär mindre användbar data. Perfekt anonymisering kan innebära inga data alls. Tillsynsmyndigheter inser svårigheten. GDPR behandlar anonymiserade data annorlunda än pseudonymiserade data, men gränsen mellan dem är suddig. Omidentifiering är ofta bara en fråga om ansträngning.
Anonymiseringstekniker
- Undertryckning — ta bort identifierare helt
- Generalisering — ersätt specifika värden med intervall
- Pseudonymisering — byt identifierare mot falska, reversibla med en nyckel
- Differentiell integritet — lägg till statistiskt brus för att skydda individer
- Syntetiska data — generera artificiella poster som efterliknar verkliga mönster
Anonymisering minskar risken. Den eliminerar den inte. Hantera anonymiserad data med försiktighet.
Comments (3)
Leave a comment