O Big Data descreve conjuntos de dados demasiado grandes ou demasiado complexos para as ferramentas tradicionais. O volume é uma dimensão. A velocidade é outra: dados que chegam em tempo real dos sensores, registos e fluxos de cliques. A variedade abrange a combinação de tabelas estruturadas, texto não estruturado, imagens e vídeos. Os três Vs têm sido a definição padrão durante anos. Alguns acrescentam a veracidade, a questão de saber se os dados são fiáveis.
As ferramentas evoluíram para lidar com a escala. O Hadoop distribuiu o armazenamento e o processamento por servidores comuns. O Spark adicionou computação em memória para aumentar a velocidade. As bases de dados NoSQL lidavam com dados não estruturados com os quais os sistemas relacionais tinham dificuldades. As plataformas na cloud transformaram a infraestrutura de big data num serviço. O hype atingiu o auge por volta de 2015. Todas as empresas queriam um data lake. Muitas construíram os seus e nunca utilizaram os dados. A tecnologia funciona. O difícil é fazer as perguntas certas e ter as competências para as responder. O big data não é valioso apenas por ser grande. É valioso quando revela algo que um conjunto de dados mais pequeno não revelaria. Na maioria das vezes, uma amostra bem concebida supera um conjunto de dados completo e desorganizado.
As dimensões do big data
- Volume — terabytes a petabytes
- Velocidade — fluxos em tempo real ou quase em tempo real
- Variedade — estruturada, semiestruturada e não estruturada
- Veracidade — precisão e fiabilidade
- Valor — insights que justificam o custo
O big data é uma ferramenta, não um fim em si mesmo. O objetivo é tomar melhores decisões. O tamanho, por si só, não garante isso.
Comments
No comments yet. Be the first to share a thought.
Leave a comment