Pipeline data memindahkan data dari sumber ke tujuan melalui serangkaian langkah. Ekstrak dari sumber. Transformasikan agar sesuai dengan target. Muat ke dalam penyimpanan. Kemudian sediakan untuk analisis. Pipeline berjalan secara otomatis, sesuai jadwal atau sebagai respons terhadap peristiwa. Pipeline menangani infrastruktur sehingga analis dan ilmuwan data dapat fokus pada penggunaan data daripada memindahkannya.
Pipeline bervariasi dari yang sederhana hingga yang kompleks. Sebuah pekerjaan harian yang menyalin file CSV adalah sebuah pipeline. Sistem streaming yang memproses jutaan peristiwa per detik juga merupakan sebuah pipeline. Alat yang digunakan pun beragam: Airflow, Dagster, Prefect untuk orkestrasi. Kafka, Kinesis, dan Pub/Sub untuk streaming. dbt untuk transformasi. Tantangannya tetap sama. Sumber data berubah tanpa peringatan. Data datang terlambat atau tidak valid. Pekerjaan gagal pada pukul 2 pagi dan tidak ada yang menyadarinya sampai laporan pagi kosong. Pipeline yang baik memiliki pemantauan, peringatan, logika percobaan ulang, dan langkah-langkah idempoten yang dapat dijalankan dua kali tanpa menduplikasi data. Pipeline tersebut didokumentasikan sehingga siapa pun dapat memahami apa yang dilakukannya. Pipeline tersebut diuji sehingga perubahan tidak merusak sistem hilir. Sebuah pipeline adalah infrastruktur. Seperti infrastruktur lainnya, pipeline bekerja paling baik ketika tidak ada yang perlu memikirkannya.
Tahapan alur kerja
- Ekstraksi — mengambil data dari berbagai sumber
- Transformasi — membersihkan, memperkaya, dan membentuk kembali
- Muat — tulis ke sistem target
- Mengatur — menjadwalkan dan mengoordinasikan langkah-langkah
- Memantau — mendeteksi dan memberi peringatan jika terjadi kegagalan
Saluran data (data pipeline) adalah rantai pasokan untuk data. Jika saluran ini rusak, semua yang ada di hilir akan berhenti.
Comments
No comments yet. Be the first to share a thought.
Leave a comment