يخزن مستودع البيانات البيانات الخام بتنسيقها الأصلي، دون فرض أي مخطط عند الكتابة. تُخزَّن الجداول المنظمة وسجلات JSON والصور والفيديوهات جميعها في نفس المستودع. يُطبَّق المخطط عند قراءة البيانات، وليس عند تخزينها. هذه المرونة هي سر جاذبيته، إذ يقبل مستودع البيانات أي نوع من البيانات، ولا يتطلب منك معرفة كيفية استخدامها قبل تخزينها.
تُعدّ المرونة أيضًا مشكلة. فبدون حوكمة، يتحوّل مستودع البيانات إلى مستنقع بيانات. لا أحد يعلم ما يحتويه. أسماء الملفات غامضة. البيانات الوصفية مفقودة. البيانات مُكرّرة عبر المجلدات. لا يستطيع المحللون العثور على ما يحتاجونه. يُضيّع علماء البيانات وقتهم في التنظيف والاستكشاف بدلًا من التحليل. يتحوّل مستودع البيانات إلى مركز تكلفة، لا أصل. الحلّ يكمن في الحوكمة: الفهارس، والبيانات الوصفية، وضوابط الوصول، وتحديد الملكية بوضوح. تُضيف بنى مستودعات البيانات الحديثة تنسيقات جداول مثل Delta Lake وIceberg التي تُوفّر فرض المخطط، ومعاملات ACID، وأداء الاستعلامات. يتقارب مستودع البيانات مع مستودع البيانات، ليجمع أفضل ما فيهما: مرونة التخزين الخام وموثوقية الجداول المهيكلة. لقد تحسّنت التكنولوجيا، لكنّ متطلبات الحوكمة لا تزال قائمة.
خصائص بحيرة البيانات
- تطبيق المخطط عند القراءة — تطبيق البنية عند الاستعلام
- التخزين الخام - البيانات المحفوظة بتنسيقها الأصلي
- قابل للتوسع — يتعامل مع بيتابايت على وحدات تخزين قياسية
- مرن - يدعم البيانات المنظمة وشبه المنظمة وغير المنظمة
- يعتمد على الحوكمة - فبدون فهرسة، يصبح مستنقعًا
بحيرة البيانات هي خزان. بدون خريطة، فهي مجرد مسطح مائي.
Comments
No comments yet. Be the first to share a thought.
Leave a comment