डेटा स्रोत वह स्रोत है जहाँ से डेटा प्राप्त होता है। डेटाबेस, एपीआई, लॉग फ़ाइलें, सेंसर, सर्वेक्षण और सार्वजनिक रिकॉर्ड सभी स्रोत के रूप में कार्य करते हैं। स्रोत ही डेटा की संरचना, गुणवत्ता और विश्वसनीयता निर्धारित करता है। प्रतिबंधों और सत्यापन के साथ सुव्यवस्थित डेटाबेस, हाथ से भरे गए स्प्रेडशीट की तुलना में अधिक स्पष्ट डेटा प्रदान करता है। अंशांकन में विचलन वाला सेंसर गलत रीडिंग देता है। सार्वजनिक डेटासेट अपूर्ण या पुराना हो सकता है।
डेटा पर भरोसा करने के लिए उसके स्रोत को जानना बेहद ज़रूरी है। यह कहाँ से आया? इसे किसने इकट्ठा किया? कब? कैसे? इसका तरीका क्या था? इसमें से क्या शामिल नहीं किया गया? ये सवाल तय करते हैं कि डेटा किस बात का समर्थन कर सकता है और किस बात का नहीं। 100 लोगों के सर्वेक्षण से प्राप्त डेटा लाखों की आबादी के बारे में किए गए दावों का समर्थन नहीं कर सकता। केवल सफल लेन-देन को रिकॉर्ड करने वाले सिस्टम से प्राप्त डेटा में विफलताएँ छूट जाती हैं। किसी विक्रेता से प्राप्त डेटा उनके उद्देश्यों के लिए सटीक हो सकता है, लेकिन आपके लिए गलत। स्रोत पाइपलाइन को भी प्रभावित करता है। एक स्थिर स्कीमा वाला डेटाबेस उस वेबसाइट की तुलना में एकीकृत करना आसान होता है जिसका HTML हर महीने बदलता रहता है। दर सीमा वाला API इस बात को सीमित करता है कि आप कितना डेटा प्राप्त कर सकते हैं। मैन्युअल रूप से प्राप्त फ़ाइल में देरी और त्रुटियाँ होने की संभावना अधिक होती है। स्रोत ही आधार है। एक कमज़ोर आधार उस पर बनी हर चीज़ को कमज़ोर कर देता है।
सामान्य डेटा स्रोत
- डेटाबेस — अनुप्रयोगों से प्राप्त संरचित रिकॉर्ड
- एपीआई — बाह्य प्रणालियों तक प्रोग्रामेटिक पहुंच
- लॉग फ़ाइलें — सिस्टम और एप्लिकेशन इवेंट
- सेंसर — निरंतर भौतिक माप
- सर्वेक्षण — लोगों से प्राप्त संरचित प्रतिक्रियाएँ
- सार्वजनिक अभिलेख — सरकारी और खुले डेटासेट
आंकड़ों पर भरोसा करने से पहले, स्रोत को समझें। अक्सर जवाब खुद आंकड़ों से कहीं अधिक जानकारीपूर्ण होते हैं।
Comments
No comments yet. Be the first to share a thought.
Leave a comment