A big data olyan adathalmazokat ír le, amelyek túl nagyok vagy túl összetettek a hagyományos eszközökhöz. A mennyiség egy dimenzió. A sebesség egy másik: valós időben érkező adatok szenzorokból, naplókból és kattintásfolyamokból. A változatosság magában foglalja a strukturált táblázatok, a strukturálatlan szöveg, a képek és a videók keverékét. A három V évek óta a standard definíció. Egyesek a hitelességet, azaz az adatok megbízhatóságának kérdését adják hozzá.
Az eszközök a méretek kezeléséhez fejlődtek. A Hadoop elosztotta a tárolást és a feldolgozást a hagyományos szerverek között. A Spark a sebesség érdekében memórián belüli számítást adott hozzá. A NoSQL adatbázisok strukturálatlan adatokat kezeltek, amelyekkel a relációs rendszerek küzdöttek. A felhőplatformok a big data infrastruktúrát szolgáltatássá alakították. A felhajtás 2015 körül tetőzött. Minden vállalat adattavat akart. Sokan építettek ugyan, de soha nem használták az adatokat. A technológia működik. A nehéz rész a megfelelő kérdések feltevése és a megválaszolásukhoz szükséges készségek megléte. A big data nem azért értékes, mert nagy. Akkor értékes, ha olyasmit fed fel, amit egy kisebb adathalmaz nem látna. Az esetek többségében egy jól megtervezett minta felülmúl egy kusza, teljes adathalmazt.
A big data dimenziói
- Mennyiség — terabájtból petabájtba
- Sebesség – valós idejű vagy közel valós idejű streamek
- Változatosság – strukturált, félig strukturált és strukturálatlan
- Valószínűség – pontosság és megbízhatóság
- Érték – olyan elemzések, amelyek igazolják a költségeket
A big data eszköz, nem cél. A cél a jobb döntések meghozatala. A méret önmagában nem biztosít megfelelő megoldást.
Comments
No comments yet. Be the first to share a thought.
Leave a comment