Hurtownia danych przechowuje zintegrowane dane z wielu źródeł do analizy. Nie jest to baza danych produkcyjna. To systemy produkcyjne zarządzają działalnością. Hurtownia obsługuje raportowanie i podejmowanie decyzji. Dane przepływają z systemów źródłowych do hurtowni poprzez potoki ETL lub ELT. Hurtownia oczyszcza, transformuje i porządkuje dane w schemacie zoptymalizowanym pod kątem zapytań. Analitycy i narzędzia Business Intelligence wysyłają zapytania do hurtowni, a nie do systemów produkcyjnych.
Architektura rozdziela obciążenia. Uruchomienie dużego zapytania analitycznego w produkcyjnej bazie danych spowalnia aplikacje używane przez klientów. Magazyn izoluje to obciążenie. Integruje również dane. Zamówienia klienta, zgłoszenia do pomocy technicznej i aktywność internetowa znajdują się w różnych systemach. Magazyn łączy je ze sobą. Z tego ujednoliconego widoku pochodzi wgląd. Tradycyjne magazyny działały na specjalistycznych urządzeniach firm Teradata, Oracle i IBM. Magazyny chmurowe, takie jak Snowflake, BigQuery i Redshift, zmieniły ekonomię. Oddzielają pamięć masową od mocy obliczeniowej, elastycznie skalują się i naliczają opłaty za użytkowanie. Bariera wejścia spadła. Mniejsze firmy mogą teraz pozwolić sobie na możliwości magazynów, które kiedyś wymagały dużych nakładów kapitałowych. Technologia się zmieniła. Cel pozostał ten sam: przechowywanie zintegrowanych danych do analizy.
Charakterystyka magazynu
- Zorientowane przedmiotowo — zorganizowane wokół domen biznesowych
- Zintegrowane — łączy dane z wielu źródeł
- Zmienny w czasie — przechowuje dane historyczne
- Nieulotne — dane są ładowane i odczytywane, a nie aktualizowane w miejscu ich przechowywania
- Zoptymalizowane pod kątem zapytań — indeksy, partycje, przechowywanie kolumnowe
Magazyn to biblioteka. Systemy źródłowe to autorzy. Analitycy to czytelnicy. Magazyn porządkuje kolekcję.
Comments
No comments yet. Be the first to share a thought.
Leave a comment