Nestrukturovaná data nemají žádný předdefinovaný formát. Textové dokumenty, e-maily, videa, zvukové nahrávky, obrázky a příspěvky na sociálních sítích se kvalifikují. Data se nevejdou do řádků a sloupců. Nedodržují schéma. Představují většinu dat, která organizace vytvářejí. Odhady uvádějí, že nestrukturovaná data tvoří 80 až 90 procent všech podnikových dat. Většina z nich zůstává nevyužita, protože tradiční nástroje je nedokážou snadno zpracovat.
Výzvou je extrakce. Abyste mohli analyzovat nestrukturovaná data, musíte jim nejprve vnutit strukturu. Zpracování přirozeného jazyka extrahuje z textu entity, sentiment a témata. Počítačové vidění identifikuje objekty a scény v obrázcích. Rozpoznávání řeči přepisuje zvuk. Každá technika převádí nestrukturovaná data do strukturované reprezentace, kterou lze analyzovat. Tato konverze je nedokonalá. Modely NLP přehlížejí nuance a sarkasmus. Modely vidění si pletou podobné objekty. Chyby v přepisu se hromadí. Strukturovaný výstup je aproximací, nikoli dokonalým odrazem. Navzdory obtížnosti mají nestrukturovaná data obrovskou hodnotu. E-maily zákazníků odhalují stížnosti a požadavky. Tikety podpory ukazují vzorce v problémech s produkty. Nahrávky hovorů zachycují tón a emoce, které text přehlíží. Organizace, které dokáží těžit z nestrukturovaných dat, získávají poznatky, které konkurence přehlíží. Nástroje se zlepšují. Výzva však zůstává.
Nestrukturované datové typy
- Text – dokumenty, e-maily, příspěvky na sociálních sítích
- Obrázky – fotografie, diagramy, skeny
- Zvuk — nahrávky, hovory, hudba
- Video — záběry, streamy, prezentace
- Binární – soubory bez definovaného textového formátu
Nestrukturovaná data jsou surovinou moderní analytiky. Extrakce hodnoty vyžaduje zavedení struktury tam, kde žádná neexistuje.
Comments
No comments yet. Be the first to share a thought.
Leave a comment