Et data warehouse lagrer integrerede data fra flere kilder til analyse. Det er ikke en produktionsdatabase. Produktionssystemer driver forretningen. Warehouset understøtter rapportering og beslutningstagning. Data flyder fra kildesystemer til warehouset via ETL- eller ELT-pipelines. Warehouset renser, transformerer og organiserer dataene i et skema, der er optimeret til forespørgsler. Analytikere og business intelligence-værktøjer forespørger warehouset i stedet for produktionssystemerne.
Arkitekturen adskiller arbejdsbyrder. At køre en tung analytisk forespørgsel på en produktionsdatabase forsinker de applikationer, som kunderne bruger. Lagerbygningen isolerer denne belastning. Den integrerer også data. En kundes ordrer, supportsager og webaktivitet findes i forskellige systemer. Lagerbygningen samler dem. Det er den samlede visning, der er, hvor indsigten kommer fra. Traditionelle lagre kørte på specialiserede apparater fra Teradata, Oracle og IBM. Cloud-lagre som Snowflake, BigQuery og Redshift ændrede økonomien. De adskiller lagring fra beregning, skalerer elastisk og opkræver efter forbrug. Adgangsbarrieren faldt. Mindre virksomheder har nu råd til lagerfunktioner, der engang krævede en stor kapitalinvestering. Teknologien ændrede sig. Formålet gjorde det ikke: at gemme integrerede data til analyse.
Lagerkarakteristika
- Fagorienteret — organiseret omkring forretningsdomæner
- Integreret — kombinerer data fra flere kilder
- Tidsvariant — gemmer historiske data
- Ikke-flygtig — data indlæses og læses, opdateres ikke på stedet
- Optimeret til forespørgsler — indekser, partitioner, kolonneformatlagring
Et lager er et bibliotek. Kildesystemer er forfatterne. Analytikere er læserne. Lageret organiserer samlingen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment