ETL je zkratka pro extrahování, transformaci, načtení. Je to standardní vzorec pro přesun dat do datových skladů po celá desetiletí. Extrakce stahuje data ze zdrojových systémů. Transformace je čistí, validuje a přetváří do cílového schématu. Načtení je zapisuje do datového skladu. Transformace probíhá před načtením na samostatném serveru pro zpracování. Databáze přijímá čistá a strukturovaná data.
Nástroje ETL se vyvíjely. Rané ETL bylo ručně kódováno v SQL a skriptech. Komerční nástroje jako Informatica a DataStage přidaly grafická rozhraní a plánování. Možnosti s otevřeným zdrojovým kódem jako Apache NiFi a Talend rozšířily přístup. Vzor zůstává stejný: extrahovat, transformovat, načíst. ETL je stále správnou volbou, když cílový systém nedokáže zvládnout transformační zátěž, když je třeba před načtením zmenšit objemy dat nebo když regulační požadavky vyžadují, aby citlivá data byla transformována předtím, než opustí kontrolované prostředí. Je také běžný ve starších prostředích, kde je datový sklad tradičním zařízením s omezenými výpočetními možnostmi. Vzestup cloudových skladů a ELT snížil dominanci ETL, ale neodstranil ji. Mnoho organizací používá obojí. ETL pro starší systémy i citlivá data. ELT pro cloudově nativní kanály. Tento vzor není zastaralý. Je to jedna z několika možností.
Charakteristiky ETL
- Nejprve transformovat – data vyčištěna před načtením
- Samostatné zpracování – transformace na dedikovaném serveru
- Snížený objem – do skladu se dostanou pouze potřebná data
- Zavedené – desítky let nástrojů a postupů
- Vhodné pro starší systémy – funguje s tradičními sklady
ETL je klasický vzor. Stále funguje. Není to vždy nejlepší volba, ale jen zřídka se mýlí.
Comments
No comments yet. Be the first to share a thought.
Leave a comment