批量處理是指按預定時間批量處理大量資料。系統不會逐筆處理到達的交易,而是將它們收集起來一起處理。銀行幾十年來一直使用批量處理來處理隔夜支票。工資系統也透過批量處理來計算工資和扣款。當效率比及時性更重要時,這種模式非常有效。
權衡之處在於延遲。凌晨 2 點運行的批次作業意味著前一天的資料要到第二天早上才能取得。對於工資和帳單處理來說,這沒問題。但對於詐欺偵測或即時定價來說,就不行了。流處理透過在資料到達時進行分析來處理這些情況。許多現代架構都同時使用這兩種方式。流處理處理緊急事件,批次處理歷史分析、資料核對和報告。兩者相輔相成。批次作業的運作成本也更低,因為它們可以安排在計算資源空閒的非高峰時段運行。 Hadoop 和 Spark 普及了分散式叢集上的大規模批次。科技不斷發展,但模式卻由來已久:收集、調度、處理、交付。
批量處理特性
- 定時運行-以既定時間間隔運行,通常在夜間運行。
- 高容量-高效處理大型資料集
- 延遲容忍型-無需立即獲得結果
- 資源利用效率高-利用非尖峰時段的運算能力
- 確定性-相同的輸入產生相同的輸出
批量處理並沒有過時。當吞吐量比速度更重要時,它仍然是正確的工具。
Comments
No comments yet. Be the first to share a thought.
Leave a comment