बिग डेटा उन डेटासेटों को दर्शाता है जो इतने बड़े या जटिल होते हैं कि पारंपरिक उपकरणों से उनका विश्लेषण करना संभव नहीं होता। मात्रा एक आयाम है। गति दूसरा आयाम है: सेंसर, लॉग और क्लिकस्ट्रीम से वास्तविक समय में प्राप्त होने वाला डेटा। विविधता में संरचित तालिकाएँ, असंरचित पाठ, चित्र और वीडियो का मिश्रण शामिल है। ये तीन 'V' (विविधता) वर्षों से इसकी मानक परिभाषा रही हैं। कुछ लोग इसमें सत्यता (वेरैसिटी) को भी जोड़ते हैं, यानी डेटा की विश्वसनीयता का प्रश्न।
बड़े पैमाने पर काम करने के लिए उपकरण विकसित हुए। हैडूप ने स्टोरेज और प्रोसेसिंग को कमोडिटी सर्वरों में वितरित किया। स्पार्क ने गति के लिए इन-मेमोरी कंप्यूटेशन को जोड़ा। NoSQL डेटाबेस ने असंरचित डेटा को संभाला, जिससे रिलेशनल सिस्टम जूझ रहे थे। क्लाउड प्लेटफॉर्म ने बिग डेटा इंफ्रास्ट्रक्चर को एक सेवा में बदल दिया। 2015 के आसपास इसका क्रेज चरम पर था। हर कंपनी एक डेटा लेक चाहती थी। कई कंपनियों ने इसे बनाया लेकिन कभी डेटा का उपयोग नहीं किया। तकनीक काम करती है। मुश्किल काम सही सवाल पूछना और उनके जवाब देने का कौशल होना है। बिग डेटा इसलिए मूल्यवान नहीं है क्योंकि यह बड़ा है। यह तब मूल्यवान होता है जब यह कुछ ऐसा प्रकट करता है जो एक छोटा डेटासेट नहीं दिखा पाता। ज्यादातर मामलों में, एक अच्छी तरह से डिज़ाइन किया गया नमूना एक अव्यवस्थित पूर्ण डेटासेट से बेहतर होता है।
बिग डेटा के आयाम
- आयतन — टेराबाइट्स से पेटाबाइट्स तक
- वेलोसिटी — वास्तविक समय या लगभग वास्तविक समय की स्ट्रीम
- विविधता — संरचित, अर्ध-संरचित और असंरचित
- सत्यता — सटीकता और विश्वसनीयता
- मूल्य — ऐसी अंतर्दृष्टि जो लागत को उचित ठहराती है
बिग डेटा एक उपकरण है, लक्ष्य नहीं। लक्ष्य बेहतर निर्णय लेना है। केवल आकार से ही ये लक्ष्य प्राप्त नहीं होते।
Comments
No comments yet. Be the first to share a thought.
Leave a comment