Dávkové zpracování zpracovává data ve velkých skupinách v plánovaných časech. Místo zpracování každé transakce hned po jejím příchodu je systém shromažďuje a spracovává dohromady. Banky používaly dávkové zpracování po celá desetiletí k vyúčtování šeků přes noc. Mzdové systémy spouštějí dávkové výpočty mezd a srážek. Model funguje, když je včasnost méně důležitá než efektivita.
Nevýhodou je latence. Dávková úloha spuštěná ve 2 hodiny ráno znamená, že data z předchozího dne nejsou k dispozici až do rána. Pro mzdy a fakturaci to stačí. Pro detekci podvodů nebo stanovení cen v reálném čase to neplatí. Streamové zpracování řeší tyto případy analýzou dat v okamžiku, kdy přicházejí. Mnoho moderních architektur používá obojí. Streamování řeší naléhavé události. Dávkové zpracování se zabývá historickou analýzou, odsouhlasením a reportingem. Tyto dva aspekty se vzájemně doplňují. Dávkové úlohy jsou také levnější na spouštění, protože je lze naplánovat mimo špičku, kdy jsou výpočetní zdroje nečinné. Hadoop a Spark popularizovaly rozsáhlé dávkové zpracování napříč distribuovanými clustery. Technologie se vyvinula, ale vzorec je starý: shromáždit, naplánovat, zpracovat, doručit.
Charakteristiky dávkového zpracování
- Plánované – běží v definovaných intervalech, často přes noc
- Velký objem – efektivně zpracovává velké datové sady
- Tolerantní k latenci – výsledky nejsou nutné okamžitě
- Efektivní využití zdrojů – využívá výpočetní kapacitu mimo špičku
- Deterministický – stejný vstup produkuje stejný výstup
Dávkové zpracování není zastaralé. Je to ten správný nástroj, když je propustnost důležitější než rychlost.
Comments
No comments yet. Be the first to share a thought.
Leave a comment