Le terme « big data » désigne des ensembles de données trop volumineux ou complexes pour les outils traditionnels. Le volume est une dimension du big data. La vélocité en est une autre : les données arrivent en temps réel, provenant de capteurs, de journaux d'activité et de flux de clics. La variété englobe la combinaison de tableaux structurés, de textes non structurés, d'images et de vidéos. Ces trois dimensions (le « volume », la « véracité » et la « variété ») constituent la définition standard depuis des années. Certains y ajoutent la véracité, c'est-à-dire la question de la fiabilité des données.
Les outils ont évolué pour gérer l'échelle. Hadoop a distribué le stockage et le traitement sur des serveurs standard. Spark a ajouté le calcul en mémoire pour plus de rapidité. Les bases de données NoSQL ont géré les données non structurées, un domaine où les systèmes relationnels peinaient. Les plateformes cloud ont transformé l'infrastructure du big data en un service. L'engouement a atteint son apogée vers 2015. Toutes les entreprises rêvaient d'un lac de données. Nombre d'entre elles en ont construit un sans jamais exploiter les données. La technologie fonctionne. La difficulté réside dans le fait de poser les bonnes questions et de posséder les compétences nécessaires pour y répondre. Le big data n'est pas précieux en soi. Il l'est lorsqu'il révèle des informations qu'un ensemble de données plus restreint ne permettrait pas de déceler. Le plus souvent, un échantillon bien conçu vaut mieux qu'un ensemble de données complet et désordonné.
Les dimensions du big data
- Volume — des téraoctets aux pétaoctets
- Velocity — flux en temps réel ou quasi réel
- Variété — structuré, semi-structuré et non structuré
- Véracité — exactitude et fiabilité
- Valeur — des connaissances qui justifient le coût
Le Big Data est un outil, pas une fin en soi. L'objectif est de prendre de meilleures décisions. La taille des données, à elle seule, ne suffit pas.
Comments
No comments yet. Be the first to share a thought.
Leave a comment