Big data opisuje zbiory danych zbyt duże lub złożone dla tradycyjnych narzędzi. Objętość to jeden wymiar. Prędkość to kolejny: dane napływające w czasie rzeczywistym z czujników, logów i strumieni kliknięć. Różnorodność obejmuje połączenie ustrukturyzowanych tabel, nieustrukturyzowanego tekstu, obrazów i wideo. Trzy V to standardowa definicja od lat. Niektórzy dodają wiarygodność, czyli pytanie, czy dane są wiarygodne.
Narzędzia ewoluowały, aby sprostać skali. Hadoop rozproszył przechowywanie i przetwarzanie danych na serwerach typu „commodity”. Spark dodał obliczenia w pamięci, aby zwiększyć szybkość. Bazy danych NoSQL obsługiwały nieustrukturyzowane dane, z którymi systemy relacyjne miały problemy. Platformy chmurowe przekształciły infrastrukturę Big Data w usługę. Szum medialny osiągnął szczyt około 2015 roku. Każda firma chciała mieć jezioro danych. Wiele z nich zbudowało je i nigdy nie wykorzystało danych. Technologia działa. Trudność polega na zadawaniu właściwych pytań i posiadaniu umiejętności, aby na nie odpowiedzieć. Big Data nie jest wartościowy ze względu na swoją wielkość. Jest wartościowy, gdy ujawnia coś, czego mniejszy zbiór danych by nie zauważył. W większości przypadków dobrze zaprojektowana próbka jest lepsza od chaotycznego, pełnego zbioru danych.
Wymiary dużych danych
- Objętość — terabajty do petabajtów
- Prędkość — strumienie w czasie rzeczywistym lub prawie rzeczywistym
- Różnorodność — strukturalna, półstrukturalna i niestrukturalna
- Prawdziwość – dokładność i wiarygodność
- Wartość — spostrzeżenia uzasadniające koszt
Big data to narzędzie, a nie cel. Celem są lepsze decyzje. Sama wielkość ich nie zapewnia.
Comments
No comments yet. Be the first to share a thought.
Leave a comment