ETL står for "extract, transform, load". Det har været standardmønsteret for at flytte data til warehouses i årtier. "Extract" henter data fra kildesystemer. "Transform" renser, validerer og omformer dem til målskemaet. "Load" skriver dem ind i warehouset. Transformationen sker før indlæsning på en separat behandlingsserver. Warehouset modtager rene, strukturerede data.
ETL-værktøjer har udviklet sig. Tidlig ETL blev håndkodet i SQL og scripts. Kommercielle værktøjer som Informatica og DataStage tilføjede grafiske grænseflader og planlægning. Open source-muligheder som Apache NiFi og Talend udvidede adgangen. Mønsteret forbliver det samme: udtræk, transformér, indlæs. ETL er stadig det rigtige valg, når målsystemet ikke kan håndtere transformationsarbejdsbelastninger, når datamængder skal reduceres før indlæsning, eller når lovgivningsmæssige krav kræver, at følsomme data transformeres, før de forlader et kontrolleret miljø. Det er også almindeligt i ældre miljøer, hvor lageret er en traditionel enhed med begrænset beregningsevne. Fremkomsten af cloud-lagre og ELT reducerede ETL's dominans, men det eliminerede den ikke. Mange organisationer kører begge dele. ETL til ældre systemer og følsomme data. ELT til cloud-native pipelines. Mønsteret er ikke forældet. Det er én mulighed blandt flere.
ETL-karakteristika
- Transformer først — data renses før indlæsning
- Separat behandling — transformation på en dedikeret server
- Reduceret volumen — kun nødvendige data når lageret
- Etableret — årtiers værktøjer og praksisser
- Traditionel venlig — fungerer med traditionelle lagre
ETL er det klassiske mønster. Det virker stadig. Det er ikke altid det bedste valg, men det er sjældent forkert.
Comments
No comments yet. Be the first to share a thought.
Leave a comment