A ingestão de dados importa dados para um sistema para processamento. É o primeiro passo no fluxo de dados. Os dados chegam de bases de dados, APIs, ficheiros de registo, filas de mensagens e sensores. A camada de ingestão recolhe-os, valida-os e encaminha-os para armazenamento ou processamento. Se a ingestão falhar, todo o processo subsequente é interrompido.
O método depende da fonte e da necessidade de latência. A ingestão em lote extrai dados em intervalos programados. É simples e eficiente para fontes que atualizam lentamente. A ingestão em fluxo contínuo processa os dados à medida que chegam, o que é necessário para análises em tempo real e sistemas orientados a eventos. As ferramentas variam: Kafka para fluxos de alto volume, Airflow para orquestração em lote e serviços nativos da cloud para pipelines geridos. Os desafios são consistentes. As fontes alteram os seus esquemas sem aviso prévio. Os dados chegam atrasados ou fora de ordem. Os volumes aumentam de forma imprevisível. A camada de ingestão deve lidar com tudo isto sem perder ou corromper dados. Os mecanismos de contrapressão evitam a sobrecarga. As filas de mensagens não entregues capturam registos que falham no processamento. A monitorização deteta problemas antes que se alastrem. A ingestão é como uma canalização, mas uma canalização deficiente inunda a casa.
Padrões de ingestão
- Lote — extrações programadas a intervalos regulares.
- Streaming — processamento contínuo à medida que os dados chegam.
- Captura de dados de alterações — captura as alterações na base de dados em tempo real.
- Consulta periódica de API — pedidos a serviços externos
- Webhooks — notificações push de sistemas de origem
A ingestão é a porta de entrada. Se os dados forem perdidos ou corrompidos aqui, nenhuma correção posterior poderá recuperá-los.
Comments
No comments yet. Be the first to share a thought.
Leave a comment