Dataanonymisering fjerner personlige identifikatorer, slik at dataene ikke kan kobles tilbake til enkeltpersoner. Navn, adresser, telefonnumre og personnummer fjernes eller erstattes. Målet er å bruke dataene til forskning eller analyse uten å avsløre noens identitet. Helseforskere anonymiserer pasientjournaler. Bedrifter anonymiserer data om brukeratferd før de deler dem med partnere.
Ekte anonymisering er vanskeligere enn det høres ut. Å fjerne navn er ikke nok. Kombinasjoner av attributter kan identifisere personer på nytt. Fødselsdato, postnummer og kjønn identifiserer sammen de fleste individer i USA unikt. Latanya Sweeney demonstrerte dette i 1997 ved å identifisere en statsguvernørs medisinske journaler på nytt fra angivelig anonyme data. Netflix Prize-datasettet ble avanonymisert i 2008 ved kryssreferanse med IMDb-rangeringer. Teknikker som k-anonymitet, differensiell personvern og syntetisk datagenerering prøver å løse problemet. Hver av dem har avveininger mellom personvern og nytteverdi. Sterkere anonymisering betyr mindre nyttige data. Perfekt anonymisering kan bety ingen data i det hele tatt. Regulatorer erkjenner vanskeligheten. GDPR behandler anonymiserte data annerledes enn pseudonymiserte data, men grensen mellom dem er uskarp. Reidentifikasjon er ofte bare et spørsmål om innsats.
Anonymiseringsteknikker
- Undertrykkelse – fjern identifikatorer fullstendig
- Generalisering – erstatt spesifikke verdier med områder
- Pseudonymisering — bytt identifikatorer med falske, reversible med en nøkkel
- Differensiell personvern – legg til statistisk støy for å beskytte enkeltpersoner
- Syntetiske data – generer kunstige poster som etterligner virkelige mønstre
Anonymisering reduserer risiko. Det eliminerer den ikke. Behandle anonymiserte data med forsiktighet.
Comments (3)
Leave a comment