डेटा को गुमनाम बनाने की प्रक्रिया में व्यक्तिगत पहचानकर्ताओं को हटा दिया जाता है ताकि डेटा को व्यक्तियों से जोड़ा न जा सके। नाम, पते, फ़ोन नंबर और सामाजिक सुरक्षा नंबर हटा दिए जाते हैं या बदल दिए जाते हैं। इसका उद्देश्य किसी की पहचान उजागर किए बिना डेटा का उपयोग अनुसंधान या विश्लेषण के लिए करना है। स्वास्थ्य सेवा शोधकर्ता रोगी रिकॉर्ड को गुमनाम बनाते हैं। कंपनियां अपने सहयोगियों के साथ साझा करने से पहले उपयोगकर्ता व्यवहार डेटा को गुमनाम बनाती हैं।
सही मायने में गुमनामी स्थापित करना जितना आसान लगता है, उतना आसान नहीं है। सिर्फ नाम हटाना काफी नहीं है। विशेषताओं के संयोजन से लोगों की पहचान दोबारा की जा सकती है। जन्मतिथि, ज़िप कोड और लिंग मिलकर संयुक्त राज्य अमेरिका में अधिकांश व्यक्तियों की विशिष्ट पहचान करते हैं। लतान्या स्वेनी ने 1997 में कथित तौर पर गुमनाम डेटा से एक राज्य के गवर्नर के मेडिकल रिकॉर्ड की पहचान करके इसे प्रदर्शित किया था। नेटफ्लिक्स प्राइज़ डेटासेट को 2008 में आईएमडीबी रेटिंग के साथ मिलान करके गुमनामी से मुक्त किया गया था। के-एनोनिमिटी, डिफरेंशियल प्राइवेसी और सिंथेटिक डेटा जेनरेशन जैसी तकनीकें इस समस्या को हल करने का प्रयास करती हैं। इनमें से प्रत्येक में गोपनीयता और उपयोगिता के बीच संतुलन बनाना पड़ता है। अधिक मजबूत गुमनामी का मतलब कम उपयोगी डेटा होता है। पूर्ण गुमनामी का मतलब बिल्कुल भी डेटा न होना भी हो सकता है। नियामक इस कठिनाई को समझते हैं। GDPR गुमनाम डेटा को छद्मनाम डेटा से अलग तरह से मानता है, लेकिन इन दोनों के बीच की रेखा धुंधली है। अक्सर, पहचान दोबारा स्थापित करना केवल प्रयास का मामला होता है।
अनामकरण तकनीकें
- दमन — पहचानकर्ताओं को पूरी तरह से हटा दें
- सामान्यीकरण — विशिष्ट मानों को श्रेणियों से बदलें
- छद्मनामीकरण — पहचानकर्ताओं को नकली पहचानकर्ताओं से बदलें, कुंजी के साथ इसे वापस पहले जैसा किया जा सकता है
- विभेदक गोपनीयता — व्यक्तियों की सुरक्षा के लिए सांख्यिकीय शोर जोड़ना
- कृत्रिम डेटा — वास्तविक पैटर्न की नकल करने वाले कृत्रिम रिकॉर्ड तैयार करना
डेटा को अनाम बनाने से जोखिम कम होता है, लेकिन यह उसे पूरी तरह खत्म नहीं करता। अनाम डेटा का सावधानीपूर्वक उपयोग करें।
Comments (3)
Leave a comment