Veri anonimleştirme, kişisel tanımlayıcıları kaldırarak verilerin bireylerle ilişkilendirilmesini engeller. İsimler, adresler, telefon numaraları ve sosyal güvenlik numaraları kaldırılır veya değiştirilir. Amaç, verileri araştırma veya analiz için kullanırken kimsenin kimliğini ifşa etmemektir. Sağlık araştırmacıları hasta kayıtlarını anonimleştirir. Şirketler, ortaklarıyla paylaşmadan önce kullanıcı davranış verilerini anonimleştirir.
Gerçek anonimleştirme, göründüğünden daha zordur. İsimleri kaldırmak yeterli değildir. Nitelik kombinasyonları kişileri yeniden tanımlayabilir. Doğum tarihi, posta kodu ve cinsiyet birlikte Amerika Birleşik Devletleri'ndeki çoğu bireyi benzersiz bir şekilde tanımlar. Latanya Sweeney bunu 1997'de, sözde anonim verilerden bir eyalet valisinin tıbbi kayıtlarını yeniden tanımlayarak göstermiştir. Netflix Ödülü veri seti, 2008'de IMDb derecelendirmeleriyle çapraz referanslama yoluyla anonimlikten çıkarılmıştır. K-anonimlik, diferansiyel gizlilik ve sentetik veri üretimi gibi teknikler sorunu çözmeye çalışır. Her birinin gizlilik ve kullanışlılık arasında ödünleşmeleri vardır. Daha güçlü anonimleştirme, daha az kullanışlı veri anlamına gelir. Mükemmel anonimleştirme, hiç veri olmaması anlamına gelebilir. Düzenleyiciler zorluğun farkındadır. GDPR, anonimleştirilmiş verileri takma adlandırılmış verilerden farklı ele alır, ancak aralarındaki çizgi bulanıktır. Yeniden tanımlama genellikle sadece bir çaba meselesidir.
Anonimleştirme teknikleri
- Gizleme — tanımlayıcıları tamamen kaldırma
- Genelleme — belirli değerleri aralıklarla değiştirme
- Takma adlandırma — tanımlayıcıları sahte olanlarla değiştirme, bir anahtar yardımıyla geri alınabilir.
- Diferansiyel gizlilik — bireyleri korumak için istatistiksel gürültü eklemek
- Sentetik veri — gerçek kalıpları taklit eden yapay kayıtlar oluşturma
Anonimleştirme riski azaltır, ancak ortadan kaldırmaz. Anonimleştirilmiş verilere dikkatli yaklaşın.
Comments (3)
Leave a comment