अर्ध-संरचित डेटा में कुछ हद तक संगठन होता है, लेकिन यह तालिकाओं में आसानी से समाहित नहीं होता। JSON, XML, YAML और ईमेल हेडर सभी इसी श्रेणी में आते हैं। डेटा में टैग या कुंजियाँ होती हैं जो इसकी संरचना का वर्णन करती हैं, लेकिन संरचना प्रत्येक रिकॉर्ड में भिन्न हो सकती है। एक JSON ऑब्जेक्ट में एक फ़ील्ड हो सकता है जो दूसरे में न हो। एक XML दस्तावेज़ में तत्वों की नेस्टिंग दूसरे से भिन्न हो सकती है। स्कीमा लचीला होता है, जिसे कभी-कभी स्कीमा-ऑन-रीड भी कहा जाता है। आप डेटा को क्वेरी करते समय संरचना लागू करते हैं, न कि उसे संग्रहीत करते समय।
आधुनिक अनुप्रयोगों में अर्ध-संरचित डेटा आम है। API JSON लौटाते हैं। लॉग फ़ाइलें कुंजी-मान युग्मों का उपयोग करती हैं। कॉन्फ़िगरेशन फ़ाइलें YAML का उपयोग करती हैं। NoSQL दस्तावेज़ डेटाबेस JSON को मूल रूप से संग्रहीत करते हैं। डेटा मॉडल के विकसित होने या बदलने पर यह लचीलापन उपयोगी होता है। यह विश्लेषण के लिए एक चुनौती भी है। अर्ध-संरचित डेटा को क्वेरी करने के लिए तालिकाओं को क्वेरी करने की तुलना में अलग उपकरणों और तकनीकों की आवश्यकता होती है। आपको नेस्टेड संरचनाओं को नेविगेट करने, गुम फ़ील्ड को संभालने और सरणियों को समतल करने की आवश्यकता होती है। SQL इंजन अनुकूलित हो गए हैं। PostgreSQL, MySQL और Snowflake सभी JSON फ़ंक्शन का समर्थन करते हैं। आप JSON दस्तावेज़ों को पहले निकाले बिना उनके अंदर क्वेरी कर सकते हैं। संरचित और अर्ध-संरचित डेटा के बीच का यह धुंधलापन इस अंतर को कम प्रासंगिक बना रहा है। महत्वपूर्ण प्रश्न यह नहीं है कि डेटा अर्ध-संरचित है या नहीं। महत्वपूर्ण यह है कि क्या आप इसे प्रभावी ढंग से क्वेरी कर सकते हैं।
अर्ध-संरचित प्रारूप
- JSON — कुंजी-मान युग्म, सरणियाँ, नेस्टेड ऑब्जेक्ट
- XML — टैग किए गए तत्व, पदानुक्रमित
- YAML — मानव-पठनीय विन्यास
- CSV — सीमांकित फ़ाइल है लेकिन इसमें टाइप की जानकारी नहीं है।
- लॉग फ़ाइलें — परिवर्तनीय फ़ील्ड वाले समय-मुहरबंद इवेंट
अर्ध-संरचित डेटा बीच का रास्ता है। इसमें उपयोगी होने के लिए पर्याप्त संरचना होती है और अव्यवस्थित होने के लिए पर्याप्त लचीलापन होता है।
Comments (2)
Leave a comment