ELT signifie extraction, chargement, transformation. Cette méthode inverse l'ordre traditionnel de l'ETL. Les données sont extraites des sources et chargées directement dans le système cible sous leur forme brute. Les transformations sont effectuées au sein du système cible, généralement un entrepôt de données cloud, en utilisant sa puissance de calcul. Cette approche s'est popularisée avec l'augmentation de la capacité des entrepôts de données cloud et la baisse de leurs coûts de traitement. Pourquoi effectuer les transformations sur un serveur distinct alors que l'entrepôt de données peut le faire plus rapidement et à moindre coût ?
L'ELT présente des avantages. Les données brutes sont conservées dans l'entrepôt de données, ce qui permet de réexécuter les transformations sans avoir à les extraire à nouveau des sources. De nouvelles transformations peuvent être appliquées a posteriori. Le système cible prend en charge les opérations les plus lourdes, simplifiant ainsi l'architecture du pipeline. Des outils comme dbt ont introduit les bonnes pratiques du génie logiciel dans la transformation : gestion de versions, tests, documentation et modularité du code. En contrepartie, l'entrepôt de données doit être suffisamment puissant pour gérer à la fois le stockage et la transformation. Cela signifie également que des données brutes, potentiellement sensibles, sont stockées dans l'entrepôt avant transformation. Des contrôles d'accès doivent donc être mis en place pour les protéger. L'ELT n'est pas systématiquement supérieur à l'ETL. Pour certaines charges de travail, la transformation avant chargement réduit le volume de données qui parviennent à l'entrepôt. Pour d'autres, la flexibilité de l'ELT est un atout. Le choix dépend des capacités du système cible et des préférences de l'équipe.
Caractéristiques de l'enseignement de l'anglais
- Chargement brut — les données sont stockées intactes dans l'entrepôt.
- Transformation sur place — le calcul de l'entrepôt gère les transformations
- Retraitables — les transformations peuvent être réexécutées sur les données brutes
- Des pipelines plus simples — moins de pièces mobiles
- Dépendant de l'entrepôt de données — nécessite une capacité de calcul évolutive
ELT est l'inverse d'ETL. L'entrepôt de données effectue le travail. Le pipeline se contente de déplacer les données.
Comments
No comments yet. Be the first to share a thought.
Leave a comment