Um data warehouse armazena dados integrados de múltiplas fontes para análise. Não se trata de uma base de dados de produção. Os sistemas de produção são responsáveis pela operação do negócio. O data warehouse suporta a geração de relatórios e a tomada de decisões. Os dados fluem dos sistemas de origem para o data warehouse através de pipelines ETL ou ELT. O data warehouse limpa, transforma e organiza os dados num esquema otimizado para consultas. Os analistas e ferramentas de business intelligence consultam o data warehouse em vez dos sistemas de produção.
A arquitetura separa as cargas de trabalho. A execução de uma consulta analítica complexa numa base de dados de produção torna os aplicativos utilizados pelos clientes mais lentos. O data warehouse isola essa carga. Também integra os dados. Os pedidos, denominados de suporte e atividades web de um cliente residem em sistemas diferentes. O data warehouse reúne-os. É desta visão unificada que surgem os insights. Os data warehouses tradicionais funcionavam em appliances especializados da Teradata, Oracle e IBM. Os data warehouses na nuvem, como o Snowflake, o BigQuery e o Redshift, mudaram a economia. Separam o armazenamento do processamento, escalam elasticamente e cobram pelo uso. A barreira de entrada caiu. As empresas mais pequenas podem agora investir em recursos de data warehouse que antes exigiam um grande investimento de capital. A tecnologia mudou. O propósito, não: armazenar dados integrados para análise.
Características do armazém
- Orientado por assuntos — organizado em torno de domínios empresariais.
- Integrado — combina dados de múltiplas fontes.
- Variável no tempo — mantém os dados históricos
- Não volátil — os dados são carregados e lidos, não são atualizados no local.
- Otimizado para consultas — índices, partições, armazenamento colunar
Um armazém é uma biblioteca. Os sistemas de origem são os autores. Os analistas são os leitores. O armazém organiza a coleção.
Comments
No comments yet. Be the first to share a thought.
Leave a comment