大數據指的是規模過大或過於複雜,傳統工具無法處理的資料集。資料量是其中一個維度。速度是另一個維度:資料即時從感測器、日誌和點擊流等來源到達。多樣性涵蓋了結構化表格、非結構化文字、圖像和影片等多種資料類型。這三個「V」多年來一直是大數據的標準定義。有些人還會加上真實性,也就是數據是否可信的問題。
為了因應資料規模的擴張,各種工具也隨之發展。 Hadoop 將儲存和處理分散在通用伺服器上。 Spark 增加了記憶體運算功能,提高了速度。 NoSQL 資料庫能夠處理關聯式系統難以處理的非結構化資料。雲端平台將大數據基礎設施轉化為服務。這股熱潮在 2015 年左右達到頂峰。幾乎每家公司都想要一個資料湖。許多公司建造了資料湖,卻從未真正使用過其中的資料。技術本身是有效的。難度在於提出正確的問題,並具備解答這些問題的能力。大數據的價值不在於其規模龐大,而在於它能夠揭示小型資料集所遺漏的資訊。大多數情況下,精心設計的樣本勝過雜亂無章的完整資料集。
大數據維度
- 容量——從太字節到拍字節
- 速度-即時或近即時串流
- 多樣性—結構化、半結構化和非結構化
- 真實性——準確性和可信度
- 價值-能夠證明成本合理的洞見
大數據是一種工具,而非目標。目標是做出更明智的決策。單靠資料規模本身並不能實現這一目標。
Comments
No comments yet. Be the first to share a thought.
Leave a comment