Batchbehandling håndterer data i store grupper på planlagte tidspunkter. I stedet for at behandle hver transaktion, når den ankommer, indsamler systemet dem og kører dem sammen. Banker brugte batchbehandling i årtier til at cleare checks natten over. Lønsystemer kører batcher for at beregne lønninger og fradrag. Modellen fungerer, når rettidighed er mindre vigtig end effektivitet.
Ulempen er latenstid. Et batchjob, der kører kl. 2 om natten, betyder, at data fra den foregående dag ikke er tilgængelige før om morgenen. Det er fint for løn og fakturering. Det er ikke tilfældet for svindeldetektering eller prisfastsættelse i realtid. Streambehandling håndterer disse sager ved at analysere data, når de ankommer. Mange moderne arkitekturer bruger begge dele. Streaming håndterer presserende hændelser. Batch håndterer historisk analyse, afstemning og rapportering. De to supplerer hinanden. Batchjob er også billigere at køre, fordi de kan planlægges uden for spidsbelastningstider, når computerressourcerne er inaktive. Hadoop og Spark populariserede storstilet batchbehandling på tværs af distribuerede klynger. Teknologien udviklede sig, men mønsteret er gammelt: indsaml, planlæg, behandl, lever.
Karakteristika for batchbehandling
- Planlagt — kører med definerede intervaller, ofte natten over
- Høj volumen — behandler store datasæt effektivt
- Latenstolerant — resultater er ikke nødvendige med det samme
- Ressourceeffektiv — udnytter computerkapaciteten uden for spidsbelastningsperioder
- Deterministisk — samme input producerer samme output
Batchbehandling er ikke forældet. Det er det rigtige værktøj, når gennemløb betyder mere end hastighed.
Comments
No comments yet. Be the first to share a thought.
Leave a comment