Big Data beschreibt Datensätze, die für herkömmliche Werkzeuge zu groß oder zu komplex sind. Das Datenvolumen ist eine Dimension. Die Verarbeitungsgeschwindigkeit ist eine weitere: Daten, die in Echtzeit von Sensoren, Protokollen und Klickströmen eintreffen. Die Datenvielfalt umfasst die Mischung aus strukturierten Tabellen, unstrukturiertem Text, Bildern und Videos. Diese drei Vs gelten seit Jahren als Standarddefinition. Manche ergänzen die Definition um die Frage der Verlässlichkeit der Daten.
Die Werkzeuge wurden weiterentwickelt, um mit dem Umfang umzugehen. Hadoop verteilte Speicherung und Verarbeitung auf Standardservern. Spark fügte In-Memory-Berechnungen für höhere Geschwindigkeiten hinzu. NoSQL-Datenbanken verarbeiteten unstrukturierte Daten, mit denen relationale Systeme Schwierigkeiten hatten. Cloud-Plattformen machten Big-Data-Infrastruktur zu einem Service. Der Hype erreichte um 2015 seinen Höhepunkt. Jedes Unternehmen wollte einen Data Lake. Viele bauten sie und nutzten die Daten nie. Die Technologie funktioniert. Die Schwierigkeit besteht darin, die richtigen Fragen zu stellen und die Fähigkeiten zu besitzen, sie zu beantworten. Big Data ist nicht wertvoll, weil es groß ist. Es ist wertvoll, wenn es etwas offenbart, das ein kleinerer Datensatz übersehen würde. Meistens ist eine gut konzipierte Stichprobe einem unübersichtlichen, vollständigen Datensatz überlegen.
Die Dimensionen von Big Data
- Volumen – Terabyte bis Petabyte
- Geschwindigkeit – Echtzeit- oder nahezu Echtzeit-Streams
- Vielfalt – strukturiert, halbstrukturiert und unstrukturiert
- Wahrhaftigkeit – Genauigkeit und Vertrauenswürdigkeit
- Wert – Erkenntnisse, die die Kosten rechtfertigen
Big Data ist ein Werkzeug, kein Ziel. Das Ziel sind bessere Entscheidungen. Datenmenge allein führt nicht dazu.
Comments
No comments yet. Be the first to share a thought.
Leave a comment