L'anonymisation des données supprime les identifiants personnels afin qu'il soit impossible de relier les données à des individus. Les noms, adresses, numéros de téléphone et numéros de sécurité sociale sont supprimés ou remplacés. L'objectif est d'utiliser les données à des fins de recherche ou d'analyse sans révéler l'identité de quiconque. Les chercheurs du secteur de la santé anonymisent les dossiers des patients. Les entreprises anonymisent les données comportementales des utilisateurs avant de les partager avec leurs partenaires.
L'anonymisation véritable est plus complexe qu'il n'y paraît. Supprimer les noms ne suffit pas. La combinaison d'attributs permet de réidentifier les personnes. Aux États-Unis, la date de naissance, le code postal et le sexe, par exemple, permettent d'identifier la plupart des individus de manière unique. Latanya Sweeney l'a démontré en 1997 en réidentifiant le dossier médical d'un gouverneur d'État à partir de données supposément anonymisées. L'ensemble de données du Netflix Prize a été désanonymisé en 2008 grâce à un recoupement avec les notes IMDb. Des techniques comme le k-anonymat, la confidentialité différentielle et la génération de données synthétiques tentent de résoudre ce problème. Chacune d'elles présente des compromis entre confidentialité et utilité. Une anonymisation plus poussée signifie des données moins exploitables. Une anonymisation parfaite peut même entraîner la disparition totale des données. Les autorités de réglementation sont conscientes de cette difficulté. Le RGPD traite les données anonymisées différemment des données pseudonymisées, mais la frontière entre les deux est floue. La réidentification est souvent une simple question d'effort.
Techniques d'anonymisation
- Suppression — suppression complète des identifiants
- Généralisation — remplacer les valeurs spécifiques par des plages de valeurs
- Pseudonymisation — remplacement des identifiants par de faux, réversible grâce à une clé
- Confidentialité différentielle — ajouter du bruit statistique pour protéger les individus
- Données synthétiques — générer des enregistrements artificiels qui imitent des modèles réels
L’anonymisation réduit les risques, mais ne les élimine pas. Traitez les données anonymisées avec précaution.
Comments (3)
Leave a comment