تُزيل عملية إخفاء هوية البيانات المعلومات الشخصية، بحيث لا يمكن ربط البيانات بالأفراد. تُحذف الأسماء والعناوين وأرقام الهواتف وأرقام الضمان الاجتماعي أو تُستبدل. والهدف هو استخدام البيانات لأغراض البحث أو التحليل دون الكشف عن هوية أي شخص. يقوم باحثو الرعاية الصحية بإخفاء هوية سجلات المرضى، كما تقوم الشركات بإخفاء هوية بيانات سلوك المستخدمين قبل مشاركتها مع شركائها.
إن إخفاء الهوية الحقيقي أصعب مما يبدو. فإزالة الأسماء وحدها لا تكفي، إذ يمكن إعادة تحديد هوية الأشخاص من خلال مجموعة من السمات. على سبيل المثال، يُمكن لتاريخ الميلاد والرمز البريدي والجنس تحديد هوية معظم الأفراد في الولايات المتحدة بشكل فريد. وقد أثبتت لاتانيا سويني ذلك عام ١٩٩٧ عندما أعادت تحديد هوية السجلات الطبية لحاكم ولاية من بيانات يُفترض أنها مجهولة المصدر. كما تم الكشف عن هوية مجموعة بيانات جائزة نتفليكس عام ٢٠٠٨ من خلال الربط بينها وبين تقييمات موقع IMDb. وتسعى تقنيات مثل إخفاء الهوية k، والخصوصية التفاضلية، وتوليد البيانات الاصطناعية إلى حل هذه المشكلة، إلا أن لكل منها مفاضلات بين الخصوصية والفائدة. فكلما كان إخفاء الهوية أقوى، قلت فائدة البيانات، بينما قد يعني إخفاء الهوية التام عدم وجود بيانات على الإطلاق. وتُدرك الجهات التنظيمية صعوبة هذا الأمر، إذ يُعامل نظام حماية البيانات العامة (GDPR) البيانات المجهولة بشكل مختلف عن البيانات المُستعارة، لكن الخط الفاصل بينهما غير واضح. وغالبًا ما تكون إعادة تحديد الهوية مسألة جهد فحسب.
تقنيات إخفاء الهوية
- الحجب — إزالة المعرفات بالكامل
- التعميم - استبدال القيم المحددة بنطاقات
- إخفاء الهوية - استبدال المعرفات بمعرفات وهمية، ويمكن عكس هذه العملية باستخدام مفتاح.
- الخصوصية التفاضلية - إضافة ضوضاء إحصائية لحماية الأفراد
- البيانات الاصطناعية - توليد سجلات اصطناعية تحاكي الأنماط الحقيقية
يُقلل إخفاء الهوية من المخاطر، لكنه لا يُزيلها تماماً. لذا، تعامل مع البيانات المجهولة الهوية بحذر.
Comments (3)
Leave a comment