डेटा क्लीनिंग डेटा में मौजूद त्रुटियों को ढूंढकर उन्हें ठीक करती है। इसमें डुप्लिकेट डेटा, गुम डेटा, असंगत फॉर्मेट, टाइपिंग की गलतियाँ और असामान्य डेटा शामिल हैं। डेटा से संबंधित काम का यह हिस्सा सबसे कम आकर्षक होता है और अक्सर सबसे अधिक समय लेने वाला भी। विश्लेषक बताते हैं कि वे अपने समय का 60 से 80 प्रतिशत हिस्सा क्लीनिंग पर खर्च करते हैं। बाकी समय विश्लेषण में लगता है। क्लीनिंग अनिवार्य है। दूषित डेटा से गलत उत्तर मिलते हैं। खराब डेटा पर प्रशिक्षित मॉडल गलत पूर्वानुमान लगाते हैं। डुप्लिकेट डेटा पर आधारित रिपोर्ट कुल योग को बढ़ा-चढ़ाकर दिखाती है।
यह कार्य व्यवस्थित है। डेटा की संरचना और समस्याओं को समझने के लिए उसका विश्लेषण करें। प्रारूपों को मानकीकृत करें: तिथियां, फ़ोन नंबर, पते। रिकॉर्ड हटाकर, मान भरकर या समीक्षा के लिए चिह्नित करके गुम मानों को संभालें। सटीक मिलान विफल होने पर फ़ज़ी मैचिंग का उपयोग करके रिकॉर्डों को डुप्लिकेट होने से बचाएं। ज्ञात सीमाओं के विरुद्ध सत्यापन करें। प्रत्येक रूपांतरण का दस्तावेज़ीकरण करें ताकि प्रक्रिया को दोहराया जा सके। स्वचालित उपकरण सहायक होते हैं, लेकिन वे विवेक का स्थान नहीं ले सकते। एक सफाई स्क्रिप्ट जो हर आउटलायर को हटा देती है, वह वैध एज केस को भी हटा सकती है। एक डुप्लिकेशन एल्गोरिदम एक ही नाम वाले दो अलग-अलग ग्राहकों को मिला सकता है। सफाई के लिए डेटा की संरचना ही नहीं, बल्कि उसके संदर्भ को समझना भी आवश्यक है। लक्ष्य परिपूर्ण डेटा नहीं है। लक्ष्य ऐसा डेटा है जो अपने उद्देश्य के लिए उपयुक्त हो। विभिन्न विश्लेषण अलग-अलग स्तर की गड़बड़ी को सहन कर सकते हैं।
सामान्य डेटा सफाई कार्य
- डुप्लिकेशन हटाना — डुप्लिकेट रिकॉर्ड हटाना या मर्ज करना
- मानकीकरण — तिथियों, नामों और पतों के लिए एक समान प्रारूप
- अनुपलब्ध मानों का प्रबंधन — मान भरना, हटाना या चिह्नित करना
- आउटलायर डिटेक्शन — विसंगतियों की पहचान और जांच करें
- सत्यापन — व्यावसायिक नियमों और बाधाओं के विरुद्ध जाँच करना
उपयोगी विश्लेषण के लिए डेटा की सफाई आवश्यक है। यदि इसे छोड़ दिया जाए तो विश्लेषण व्यर्थ हो जाता है। यदि इसे ठीक से किया जाए तो बाकी काम आसान हो जाता है।
Comments
No comments yet. Be the first to share a thought.
Leave a comment