資料匿名化會移除個人識別識別訊息,使資料無法追溯到個人。姓名、地址、電話號碼和社會安全號碼都會被刪除或取代。其目的是在不洩露任何人身份的情況下,將資料用於研究或分析。醫療保健研究人員會對病患記錄進行匿名化處理。公司在與合作夥伴分享使用者行為資料之前,也會對其進行匿名化處理。
真正的匿名化比聽起來要難得多。僅僅移除姓名是不夠的。屬性組合可以重新識別個人身分。在美國,出生日期、郵遞區號和性別組合起來就能唯一地辨識大多數人。拉坦婭·斯威尼 (Latanya Sweeney) 在 1997 年就證明了這一點,她從所謂的匿名數據中重新識別出了一位州長的醫療記錄。 2008 年,Netflix Prize 資料集透過與 IMDb 評分交叉比對而被去匿名化。諸如 k-匿名性、差分隱私和合成資料生成等技術試圖解決這個問題。每種技術都在隱私和實用性之間做出權衡。更強的匿名化意味著數據的實用性降低。完美的匿名化可能意味著完全沒有數據。監管機構也意識到了其中的困難。 GDPR 對匿名資料和假名化資料的處理方式不同,但兩者之間的界線仍然模糊不清。重新識別往往只是需要花費一些精力而已。
匿名化技術
- 抑制-完全移除標識符
- 概括——用範圍取代具體值。
- 假名化-以虛假標識符取代現有標識符,可透過密鑰恢復原狀。
- 差分隱私-透過添加統計雜訊來保護個人隱私
- 合成資料-產生模仿真實模式的人工記錄
匿名化可以降低風險,但並不能消除風險。請謹慎對待匿名化數據。
Comments (3)
Leave a comment