EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 資料匿名化

從資料中移除個人識別碼以保護隱私。

資料匿名化

資料匿名化會移除個人識別識別訊息,使資料無法追溯到個人。姓名、地址、電話號碼和社會安全號碼都會被刪除或取代。其目的是在不洩露任何人身份的情況下,將資料用於研究或分析。醫療保健研究人員會對病患記錄進行匿名化處理。公司在與合作夥伴分享使用者行為資料之前,也會對其進行匿名化處理。

真正的匿名化比聽起來要難得多。僅僅移除姓名是不夠的。屬性組合可以重新識別個人身分。在美國,出生日期、郵遞區號和性別組合起來就能唯一地辨識大多數人。拉坦婭·斯威尼 (Latanya Sweeney) 在 1997 年就證明了這一點,她從所謂的匿名數據中重新識別出了一位州長的醫療記錄。 2008 年,Netflix Prize 資料集透過與 IMDb 評分交叉比對而被去匿名化。諸如 k-匿名性、差分隱私和合成資料生成等技術試圖解決這個問題。每種技術都在隱私和實用性之間做出權衡。更強的匿名化意味著數據的實用性降低。完美的匿名化可能意味著完全沒有數據。監管機構也意識到了其中的困難。 GDPR 對匿名資料和假名化資料的處理方式不同,但兩者之間的界線仍然模糊不清。重新識別往往只是需要花費一些精力而已。

匿名化技術

匿名化可以降低風險,但並不能消除風險。請謹慎對待匿名化數據。

Comments (3)

  1. Tara Nguyen
    Work in healthcare data and this is a constant challenge. Removing names isn't enough, you have to think about re-identification through combinations of fields.
  2. Ben Whitaker
    Is anonymization actually possible or is it more about making re-identification impractical? Seems like a spectrum rather than a binary.
  3. Sofia Marchetti
    The GDPR stuff around this is a nightmare to navigate but I get why it matters.

Leave a comment