El big data describe conjuntos de datos demasiado grandes o complejos para las herramientas tradicionales. El volumen es una dimensión. La velocidad es otra: datos que llegan en tiempo real desde sensores, registros y flujos de clics. La variedad abarca la combinación de tablas estructuradas, texto no estructurado, imágenes y vídeo. Las tres V han sido la definición estándar durante años. Algunos añaden la veracidad, es decir, la cuestión de si los datos son fiables.
Las herramientas evolucionaron para gestionar la escala. Hadoop distribuyó el almacenamiento y el procesamiento en servidores estándar. Spark añadió computación en memoria para mayor velocidad. Las bases de datos NoSQL gestionaron datos no estructurados con los que los sistemas relacionales tenían dificultades. Las plataformas en la nube convirtieron la infraestructura de big data en un servicio. El entusiasmo alcanzó su punto máximo alrededor de 2015. Todas las empresas querían un lago de datos. Muchas los construyeron y nunca utilizaron los datos. La tecnología funciona. Lo difícil es formular las preguntas correctas y tener las habilidades para responderlas. El big data no es valioso por ser grande. Es valioso cuando revela algo que un conjunto de datos más pequeño pasaría por alto. La mayoría de las veces, una muestra bien diseñada supera a un conjunto de datos completo y desordenado.
Las dimensiones del big data
- Volumen: de terabytes a petabytes
- Velocidad: transmisiones en tiempo real o casi en tiempo real.
- Variedad: estructurada, semiestructurada y no estructurada.
- Veracidad: exactitud y confiabilidad
- Valor: información que justifica el costo.
El big data es una herramienta, no un fin en sí mismo. El objetivo es tomar mejores decisiones. El tamaño por sí solo no las garantiza.
Comments
No comments yet. Be the first to share a thought.
Leave a comment