Большие данные описывают наборы данных, слишком большие или сложные для традиционных инструментов. Объём — это одно измерение. Скорость — другое: данные поступают в режиме реального времени с датчиков, из журналов и потоков кликов. Разнообразие охватывает сочетание структурированных таблиц, неструктурированного текста, изображений и видео. Три «V» уже много лет являются стандартным определением. Некоторые добавляют к этому понятие достоверности — вопроса о том, заслуживают ли данные доверия.
Инструменты развивались, чтобы справиться с масштабом. Hadoop распределял хранение и обработку данных по стандартным серверам. Spark добавил вычисления в оперативной памяти для повышения скорости. NoSQL-базы данных обрабатывали неструктурированные данные, с которыми реляционные системы испытывали трудности. Облачные платформы превратили инфраструктуру больших данных в сервис. Ажиотаж достиг пика примерно в 2015 году. Каждая компания хотела иметь озеро данных. Многие создали их, но так и не использовали данные. Технология работает. Сложность заключается в том, чтобы задавать правильные вопросы и обладать навыками для ответа на них. Большие данные ценны не потому, что они большие. Они ценны, когда выявляют то, что упустил бы меньший набор данных. В большинстве случаев хорошо продуманная выборка лучше, чем неряшливый полный набор данных.
Размеры больших данных
- Объём — от терабайтов до петабайтов
- Скорость — потоки в реальном или почти реальном времени.
- Разнообразие — структурированное, полуструктурированное и неструктурированное
- Правдивость — точность и достоверность
- Ценность — выводы, оправдывающие затраты.
Большие данные — это инструмент, а не цель. Цель — принятие более эффективных решений. Одних только масштабов недостаточно для этого.
Comments
No comments yet. Be the first to share a thought.
Leave a comment