ETL står for «extract, transform, load». Det har vært standardmønsteret for å flytte data til lagre i flere tiår. «Extract» henter data fra kildesystemer. «Transform» renser, validerer og omformer dem til målskjemaet. «Load» skriver dem inn i lageret. Transformasjonen skjer før lasting, på en separat behandlingsserver. Lageret mottar rene, strukturerte data.
ETL-verktøy har utviklet seg. Tidlig ETL ble håndkodet i SQL og skript. Kommersielle verktøy som Informatica og DataStage la til grafiske grensesnitt og planlegging. Åpen kildekode-alternativer som Apache NiFi og Talend utvidet tilgangen. Mønsteret er fortsatt det samme: uttrekk, transformer, last inn. ETL er fortsatt det riktige valget når målsystemet ikke kan håndtere transformasjonsarbeidsmengder, når datavolumer må reduseres før lasting, eller når regulatoriske krav krever at sensitive data transformeres før de forlater et kontrollert miljø. Det er også vanlig i eldre miljøer der lageret er en tradisjonell apparat med begrenset beregningsevne. Fremveksten av skylagre og ELT reduserte ETLs dominans, men eliminerte den ikke. Mange organisasjoner kjører begge deler. ETL for eldre systemer og sensitive data. ELT for skybaserte pipelines. Mønsteret er ikke foreldet. Det er ett alternativ blant flere.
ETL-egenskaper
- Transformer først – dataene renses før lasting
- Separat prosessering – transformasjon på en dedikert server
- Redusert volum – kun nødvendige data når lageret
- Etablert – flere tiår med verktøy og praksis
- Tradisjonsvennlig – fungerer med tradisjonelle varehus
ETL er det klassiske mønsteret. Det fungerer fortsatt. Det er ikke alltid det beste valget, men det er sjelden feil.
Comments
No comments yet. Be the first to share a thought.
Leave a comment