EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 数据匿名化

从数据中移除个人标识符以保护隐私。

数据匿名化

数据匿名化会移除个人身份标识信息,使数据无法追溯到个人。姓名、地址、电话号码和社会安全号码都会被删除或替换。其目的是在不泄露任何人身份的情况下,将数据用于研究或分析。医疗保健研究人员会对患者记录进行匿名化处理。公司在与合作伙伴共享用户行为数据之前,也会对其进行匿名化处理。

真正的匿名化比听起来要难得多。仅仅移除姓名是不够的。属性组合可以重新识别个人身份。在美国,出生日期、邮政编码和性别组合起来就能唯一地识别大多数人。拉坦娅·斯威尼 (Latanya Sweeney) 在 1997 年就证明了这一点,她从所谓的匿名数据中重新识别出了一位州长的医疗记录。2008 年,Netflix Prize 数据集通过与 IMDb 评分交叉比对而被去匿名化。诸如 k-匿名性、差分隐私和合成数据生成等技术试图解决这个问题。每种技术都在隐私和实用性之间做出权衡。更强的匿名化意味着数据的实用性降低。完美的匿名化可能意味着完全没有数据。监管机构也意识到了其中的困难。GDPR 对匿名数据和假名化数据的处理方式不同,但两者之间的界限仍然模糊不清。重新识别往往只是需要花费一些精力而已。

匿名化技术

匿名化可以降低风险,但并不能消除风险。请谨慎对待匿名化数据。

Comments (3)

  1. Tara Nguyen
    Work in healthcare data and this is a constant challenge. Removing names isn't enough, you have to think about re-identification through combinations of fields.
  2. Ben Whitaker
    Is anonymization actually possible or is it more about making re-identification impractical? Seems like a spectrum rather than a binary.
  3. Sofia Marchetti
    The GDPR stuff around this is a nightmare to navigate but I get why it matters.

Leave a comment