डेटा संग्रह विभिन्न स्रोतों से जानकारी एकत्र करता है। सर्वेक्षण, सेंसर, वेब लॉग, लेन-देन रिकॉर्ड, सोशल मीडिया और सार्वजनिक डेटाबेस, ये सभी इस प्रक्रिया में योगदान देते हैं। विधि डेटा को प्रभावित करती है। भ्रामक प्रश्नों वाला सर्वेक्षण पक्षपातपूर्ण उत्तर देता है। कैलिब्रेशन में गड़बड़ी वाला सेंसर गलत रीडिंग देता है। दर सीमा का उल्लंघन करने वाले वेब स्क्रैपर को ब्लॉक कर दिया जाता है। डेटा संग्रह निष्पक्ष नहीं होता। हर विकल्प आपके सीखने को प्रभावित करता है।
पहला सवाल यह है कि आपको क्या चाहिए और क्यों। सब कुछ इकट्ठा करना लुभावना होता है, लेकिन आमतौर पर यह व्यर्थ ही होता है। डेटा स्टोरेज में पैसा लगता है। प्रोसेसिंग में पैसा लगता है। डेटा को साफ करने में पैसा लगता है। बिना इस्तेमाल किया हुआ डेटा एक देनदारी है, संपत्ति नहीं। दूसरा सवाल यह है कि इसे नैतिक और कानूनी रूप से कैसे इकट्ठा किया जाए। सहमति महत्वपूर्ण है। GDPR जैसे गोपनीयता कानूनों के तहत व्यक्तिगत डेटा इकट्ठा करने के लिए एक कानूनी आधार होना आवश्यक है। कई प्लेटफॉर्म पर सेवा की शर्तें डेटा स्क्रैपिंग को प्रतिबंधित करती हैं। तीसरा सवाल गुणवत्ता का है। क्या स्रोत विश्वसनीय है? क्या नमूना प्रतिनिधि है? क्या कोई कमियां हैं? गुणवत्ता नियंत्रण के बिना डेटा इकट्ठा करने से ऐसे डेटासेट बनते हैं जो बाद में विफल हो जाते हैं। किसी समस्या को पकड़ने का सबसे अच्छा समय डेटा के पाइपलाइन में प्रवेश करने से पहले होता है, न कि किसी के द्वारा उस पर मॉडल बनाने के बाद।
संग्रह विधियाँ
- सर्वेक्षण — संरचित प्रश्न, प्रतिक्रिया पूर्वाग्रह की संभावना
- सेंसर — स्वचालित, निरंतर, अंशांकन-संवेदनशील
- वेब स्क्रैपिंग - सार्वजनिक डेटा को निकालता है, जो कानूनी सीमाओं के अधीन है।
- लेनदेन लॉग — उपयोगकर्ता के व्यवहार को स्वचालित रूप से कैप्चर करता है
- सार्वजनिक अभिलेख — सरकारी और खुले डेटा स्रोत
डेटा संग्रह एक योजनाबद्ध निर्णय है। आप जो डेटा एकत्र करते हैं, उससे यह निर्धारित होता है कि आप क्या सीख सकते हैं। आप जो डेटा नहीं एकत्र करते, उससे यह निर्धारित होता है कि आप क्या कभी नहीं जान पाएंगे।
Comments
No comments yet. Be the first to share a thought.
Leave a comment