Egy adatfolyamat egy sor lépésen keresztül mozgatja az adatokat a forrásból a célállomásra. Kinyeri a forrásból. Átalakítja őket a célnak megfelelően. Betöltés a tárolóba. Ezután elérhetővé teszi elemzésre. A folyamat automatikusan, ütemterv szerint vagy eseményekre reagálva fut. Kezeli a csatornarendszert, így az elemzők és az adatkutatók az adatok felhasználására koncentrálhatnak a mozgatásuk helyett.
A pipeline-ok (folyamatok) az egyszerűtől az összetettig terjednek. Egy CSV-fájlt másoló éjszakai feladat egy pipeline. Egy streaming rendszer, amely másodpercenként több millió eseményt dolgoz fel, szintén egy pipeline. Az eszközök változatosak: Airflow, Dagster, Prefect a vezényléshez. Kafka, Kinesis és Pub/Sub a streameléshez. dbt az átalakításhoz. A kihívások konzisztensek. A források figyelmeztetés nélkül változnak. Az adatok késve vagy hibásan érkeznek meg. A feladatok hajnali 2-kor meghiúsulnak, és senki sem veszi észre, amíg a reggeli jelentés üres nem lesz. A jó pipeline-ok monitorozással, riasztással, újrapróbálkozási logikával és idempotens lépésekkel rendelkeznek, amelyek kétszer futtathatók az adatok duplikálása nélkül. Dokumentálva vannak, hogy bárki megértse, mit csinálnak. Tesztelve vannak, hogy a változások ne okozzanak problémát a downstream rendszerekben. A pipeline egy infrastruktúra. Mint minden infrastruktúra, akkor működik a legjobban, ha senkinek sem kell gondolkodnia rajta.
Csővezeték szakaszai
- Kivonat – adatok kinyerése forrásokból
- Átalakítás – tisztítás, gazdagítás és újraformálás
- Betöltés — írás a célrendszerre
- Összehangolás – lépések ütemezése és koordinálása
- Monitorozás – hibák észlelése és riasztás
Az adatfolyamat az adatok ellátási lánca. Ha megszakad, minden további folyamat leáll.
Comments
No comments yet. Be the first to share a thought.
Leave a comment