ETL to skrót od „extract, transform, load” (ekstrakcja, transformacja, ładowanie). Jest to standardowy schemat przenoszenia danych do hurtowni od dziesięcioleci. Ekstrakcja pobiera dane z systemów źródłowych. Transformacja oczyszcza, weryfikuje i przekształca je w schemat docelowy. Ładowanie zapisuje dane w hurtowni. Transformacja odbywa się przed załadowaniem, na oddzielnym serwerze przetwarzającym. Hurtownia otrzymuje czyste, ustrukturyzowane dane.
Narzędzia ETL ewoluowały. Wczesne ETL było ręcznie kodowane w SQL i skryptach. Narzędzia komercyjne, takie jak Informatica i DataStage, dodały interfejsy graficzne i harmonogramowanie. Opcje open source, takie jak Apache NiFi i Talend, poszerzyły dostęp. Schemat pozostaje ten sam: ekstrakcja, transformacja, ładowanie. ETL jest nadal właściwym wyborem, gdy system docelowy nie jest w stanie obsłużyć obciążeń transformacyjnych, gdy wolumeny danych wymagają redukcji przed załadowaniem lub gdy wymogi prawne wymagają transformacji poufnych danych przed opuszczeniem kontrolowanego środowiska. Jest to również powszechne w starszych środowiskach, w których magazyn danych jest tradycyjnym urządzeniem o ograniczonej mocy obliczeniowej. Rozwój magazynów danych w chmurze i ELT zmniejszył dominację ETL, ale jej nie wyeliminował. Wiele organizacji korzysta z obu. ETL dla starszych systemów i poufnych danych. ELT dla potoków chmurowych. Ten schemat nie jest przestarzały. Jest to jedna z kilku opcji.
Charakterystyka ETL
- Najpierw przekształć — dane oczyszczone przed załadowaniem
- Oddzielne przetwarzanie — transformacja na dedykowanym serwerze
- Zmniejszona objętość — do magazynu trafiają tylko niezbędne dane
- Ugruntowana — dekady narzędzi i praktyk
- Przyjazny dla starszych systemów — współpracuje z tradycyjnymi magazynami
ETL to klasyczny wzorzec. Nadal działa. Nie zawsze jest najlepszym wyborem, ale rzadko jest błędny.
Comments
No comments yet. Be the first to share a thought.
Leave a comment