ETLとは、抽出(Extract)、変換(Transform)、ロード(Load)の略です。これは、数十年にわたりデータをデータウェアハウスに移行するための標準的なパターンとなっています。抽出では、ソースシステムからデータを抽出します。変換では、データをクリーンアップ、検証し、ターゲットスキーマに整形します。ロードでは、データをデータウェアハウスに書き込みます。変換はロードの前に、別の処理サーバーで行われます。データウェアハウスは、クリーンで構造化されたデータを受け取ります。
ETLツールは進化を遂げてきました。初期のETLはSQLとスクリプトで手作業でコーディングされていました。InformaticaやDataStageといった商用ツールはグラフィカルインターフェースとスケジューリング機能を追加しました。Apache NiFiやTalendといったオープンソースツールは、アクセス範囲を広げました。基本的なパターンは、抽出、変換、ロードです。ターゲットシステムが変換ワークロードを処理できない場合、ロード前にデータ量を削減する必要がある場合、または規制要件により機密データが管理された環境から出る前に変換する必要がある場合、ETLは依然として適切な選択肢です。また、データウェアハウスがコンピューティング能力が限られた従来の機器であるレガシー環境でも一般的です。クラウドウェアハウスとELTの台頭によりETLの優位性は低下しましたが、完全に消滅したわけではありません。多くの組織は両方を使用しています。レガシーシステムと機密データにはETL、クラウドネイティブパイプラインにはELTです。このパターンは時代遅れではなく、数ある選択肢の一つに過ぎません。
ETLの特性
- まず変換する — ロード前にデータをクリーンアップする
- 別個の処理 ― 専用サーバー上での変換
- データの量を削減 ― 必要なデータのみが倉庫に届く
- 確立された — 数十年にわたるツールと実践
- 既存システムとの互換性あり ― 従来型の倉庫にも対応
ETLは古典的なパターンであり、今でも有効です。常に最良の選択肢とは限りませんが、間違った選択となることは稀です。
Comments
No comments yet. Be the first to share a thought.
Leave a comment