ETL står för extract, transform, load. Det har varit standardmönstret för att flytta data till lager i årtionden. Extract hämtar data från källsystem. Transform rensar, validerar och omformar den till målschemat. Load skriver den till lagret. Transformationen sker före laddning, på en separat bearbetningsserver. Lagret tar emot rena, strukturerade data.
ETL-verktyg har utvecklats. Tidig ETL handkodades i SQL och skript. Kommersiella verktyg som Informatica och DataStage lade till grafiska gränssnitt och schemaläggning. Öppen källkodsalternativ som Apache NiFi och Talend breddade åtkomsten. Mönstret förblir detsamma: extrahera, transformera, ladda. ETL är fortfarande rätt val när målsystemet inte kan hantera transformationsarbetsbelastningar, när datavolymer behöver minskas innan laddning, eller när myndighetskrav kräver att känslig data transformeras innan den lämnar en kontrollerad miljö. Det är också vanligt i äldre miljöer där lagret är en traditionell apparat med begränsad beräkningsförmåga. Uppkomsten av molnlager och ELT minskade ETL:s dominans, men eliminerade den inte. Många organisationer kör båda. ETL för äldre system och känslig data. ELT för molnbaserade pipelines. Mönstret är inte föråldrat. Det är ett alternativ bland flera.
ETL-egenskaper
- Transformera först — data rensas före laddning
- Separat bearbetning — transformation på en dedikerad server
- Minskad volym — endast nödvändig data når lagret
- Etablerat — årtionden av verktyg och metoder
- Äldrevänlig — fungerar med traditionella lagerlokaler
ETL är det klassiska mönstret. Det fungerar fortfarande. Det är inte alltid det bästa valet, men det är sällan fel.
Comments
No comments yet. Be the first to share a thought.
Leave a comment