Velká data popisují datové sady, které jsou pro tradiční nástroje příliš velké nebo složité. Objem je jeden rozměr. Rychlost je další: data přicházející v reálném čase ze senzorů, protokolů a kliknutí. Rozmanitost zahrnuje kombinaci strukturovaných tabulek, nestrukturovaného textu, obrázků a videa. Tři V jsou standardní definicí již léta. Někteří přidávají pravdivost, tedy otázku, zda jsou data důvěryhodná.
Nástroje se vyvinuly, aby zvládly škálování. Hadoop distribuoval úložiště a zpracování napříč komerčně dostupnými servery. Spark přidal výpočty v paměti pro zvýšení rychlosti. NoSQL databáze zpracovávaly nestrukturovaná data, se kterými se relační systémy potýkaly. Cloudové platformy proměnily infrastrukturu velkých dat ve službu. Humbuk kolem nich vrcholil kolem roku 2015. Každá společnost chtěla datové jezero. Mnohé je vytvořily a data nikdy nepoužily. Technologie funguje. Nejtěžší je klást správné otázky a mít dovednosti na ně odpovídat. Velká data nejsou cenná proto, že jsou velká. Jsou cenná, když odhalí něco, co by menší datová sada přehlédla. Většinou dobře navržený vzorek porazí chaotickou plnou datovou sadu.
Dimenze velkých dat
- Objem – terabajty na petabajty
- Rychlost — streamy v reálném čase nebo téměř v reálném čase
- Rozmanitost – strukturovaná, polostrukturovaná a nestrukturovaná
- Pravdivost – přesnost a důvěryhodnost
- Hodnota – poznatky, které ospravedlňují náklady
Velká data jsou nástroj, ne cíl. Cílem jsou lepší rozhodnutí. Samotná velikost je nedokáže přinést.
Comments
No comments yet. Be the first to share a thought.
Leave a comment