Big data beschrijft datasets die te groot of te complex zijn voor traditionele tools. Het volume is één dimensie. Snelheid is een andere: data die in realtime binnenkomen via sensoren, logbestanden en clickstreams. Variëteit omvat de mix van gestructureerde tabellen, ongestructureerde tekst, afbeeldingen en video. De drie V's zijn al jaren de standaarddefinitie. Sommigen voegen daar betrouwbaarheid aan toe, de vraag of de data wel betrouwbaar is.
De tools evolueerden om de schaalvergroting aan te kunnen. Hadoop verdeelde opslag en verwerking over standaardservers. Spark voegde in-memory berekeningen toe voor snelheid. NoSQL-databases verwerkten ongestructureerde data waar relationele systemen moeite mee hadden. Cloudplatforms maakten van big data-infrastructuur een dienst. De hype bereikte een hoogtepunt rond 2015. Elk bedrijf wilde een data lake. Velen bouwden er een, maar gebruikten de data nooit. De technologie werkt. Het lastige is de juiste vragen stellen en de vaardigheden hebben om ze te beantwoorden. Big data is niet waardevol omdat het groot is. Het is waardevol wanneer het iets onthult dat een kleinere dataset zou missen. Meestal is een goed ontworpen steekproef beter dan een rommelige, complete dataset.
De dimensies van big data
- Volume — terabytes tot petabytes
- Snelheid — realtime of bijna realtime streams
- Variatie — gestructureerd, semi-gestructureerd en ongestructureerd
- Waarachtigheid — nauwkeurigheid en betrouwbaarheid
- Waarde — inzichten die de kosten rechtvaardigen
Big data is een hulpmiddel, geen doel op zich. Het doel is betere beslissingen nemen. Alleen de omvang levert die niet op.
Comments
No comments yet. Be the first to share a thought.
Leave a comment