Hồ dữ liệu lưu trữ dữ liệu thô ở định dạng gốc. Không có lược đồ nào được áp dụng khi ghi dữ liệu. Các bảng có cấu trúc, nhật ký JSON, hình ảnh và video đều nằm trong cùng một kho lưu trữ. Lược đồ được áp dụng khi dữ liệu được đọc, chứ không phải khi nó được lưu trữ. Sự linh hoạt đó chính là điểm hấp dẫn. Hồ dữ liệu chấp nhận mọi thứ. Nó không yêu cầu bạn phải biết mình sẽ sử dụng dữ liệu như thế nào trước khi lưu trữ.
Tính linh hoạt cũng chính là vấn đề. Nếu thiếu quản trị, hồ dữ liệu sẽ trở thành một đầm lầy dữ liệu. Không ai biết trong đó có gì. Các tệp có tên khó hiểu. Siêu dữ liệu bị thiếu. Dữ liệu bị trùng lặp trong các thư mục. Các nhà phân tích không thể tìm thấy những gì họ cần. Các nhà khoa học dữ liệu lãng phí thời gian vào việc làm sạch và khám phá thay vì phân tích. Hồ dữ liệu trở thành một trung tâm chi phí, chứ không phải là một tài sản. Giải pháp là quản trị: danh mục, siêu dữ liệu, kiểm soát truy cập và quyền sở hữu rõ ràng. Kiến trúc hồ dữ liệu hiện đại bổ sung các định dạng bảng như Delta Lake và Iceberg, mang lại khả năng thực thi lược đồ, giao dịch ACID và hiệu suất truy vấn cho hồ dữ liệu. Hồ dữ liệu và kho dữ liệu hội tụ. Kết hợp những ưu điểm tốt nhất của cả hai: tính linh hoạt của lưu trữ thô và độ tin cậy của các bảng có cấu trúc. Công nghệ đã được cải thiện. Nhưng yêu cầu về quản trị vẫn còn đó.
Đặc điểm của kho dữ liệu
- Schema-on-read — áp dụng cấu trúc khi truy vấn
- Lưu trữ thô — dữ liệu được giữ nguyên định dạng ban đầu
- Có khả năng mở rộng — xử lý petabyte trên bộ nhớ lưu trữ thông thường.
- Linh hoạt — hỗ trợ dữ liệu có cấu trúc, bán cấu trúc và không có cấu trúc.
- Phụ thuộc vào quản trị — nếu không được lập danh mục, nó sẽ trở thành một đầm lầy.
Hồ dữ liệu là một hồ chứa. Nếu không có bản đồ, nó chỉ là một vùng nước mà thôi.
Comments
No comments yet. Be the first to share a thought.
Leave a comment