数据匿名化会移除个人身份标识信息,使数据无法追溯到个人。姓名、地址、电话号码和社会安全号码都会被删除或替换。其目的是在不泄露任何人身份的情况下,将数据用于研究或分析。医疗保健研究人员会对患者记录进行匿名化处理。公司在与合作伙伴共享用户行为数据之前,也会对其进行匿名化处理。
真正的匿名化比听起来要难得多。仅仅移除姓名是不够的。属性组合可以重新识别个人身份。在美国,出生日期、邮政编码和性别组合起来就能唯一地识别大多数人。拉坦娅·斯威尼 (Latanya Sweeney) 在 1997 年就证明了这一点,她从所谓的匿名数据中重新识别出了一位州长的医疗记录。2008 年,Netflix Prize 数据集通过与 IMDb 评分交叉比对而被去匿名化。诸如 k-匿名性、差分隐私和合成数据生成等技术试图解决这个问题。每种技术都在隐私和实用性之间做出权衡。更强的匿名化意味着数据的实用性降低。完美的匿名化可能意味着完全没有数据。监管机构也意识到了其中的困难。GDPR 对匿名数据和假名化数据的处理方式不同,但两者之间的界限仍然模糊不清。重新识别往往只是需要花费一些精力而已。
匿名化技术
- 抑制——完全移除标识符
- 概括——用范围替换具体值。
- 假名化——用虚假标识符替换现有标识符,可通过密钥恢复原状。
- 差分隐私——通过添加统计噪声来保护个人隐私
- 合成数据——生成模仿真实模式的人工记录
匿名化可以降低风险,但并不能消除风险。请谨慎对待匿名化数据。
Comments (3)
Leave a comment