Die Datenerfassung importiert Daten zur Verarbeitung in ein System. Sie ist der erste Schritt im Verarbeitungsprozess. Daten stammen aus Datenbanken, APIs, Protokolldateien, Message Queues und Sensoren. Die Erfassungsschicht sammelt und validiert die Daten und übergibt sie zur Speicherung oder Weiterverarbeitung. Schlägt die Erfassung fehl, wird die gesamte nachfolgende Verarbeitung gestoppt.
Die Methode hängt von der Datenquelle und den Latenzanforderungen ab. Batch-Ingestion ruft Daten in festgelegten Intervallen ab. Sie ist einfach und effizient für Datenquellen, die sich langsam aktualisieren. Streaming-Ingestion verarbeitet Daten direkt nach ihrem Eintreffen, was für Echtzeitanalysen und ereignisgesteuerte Systeme unerlässlich ist. Die Tools variieren: Kafka für Datenströme mit hohem Durchsatz, Airflow für die Batch-Orchestrierung, Cloud-native Dienste für verwaltete Pipelines. Die Herausforderungen bleiben jedoch gleich: Datenquellen ändern ihre Schemata ohne Vorwarnung. Daten treffen verspätet oder in falscher Reihenfolge ein. Datenmengen steigen unvorhersehbar an. Die Ingestionsschicht muss all dies bewältigen, ohne Daten zu verlieren oder zu beschädigen. Gegendruckmechanismen verhindern eine Überlastung. Dead-Letter-Queues erfassen Datensätze, deren Verarbeitung fehlgeschlagen ist. Monitoring erkennt Probleme, bevor sie sich ausweiten. Ingestion ist wie eine Rohrleitung – eine defekte Rohrleitung kann jedoch zu einem Wasserschaden führen.
Aufnahmemuster
- Batch – geplante Abfragen in regelmäßigen Abständen
- Streaming – kontinuierliche Verarbeitung der eintreffenden Daten.
- Änderungsdatenerfassung – erfasst Datenbankänderungen in Echtzeit
- API-Polling – regelmäßige Anfragen an externe Dienste
- Webhooks – Push-Benachrichtigungen von Quellsystemen
Die Datenerfassung ist der erste Schritt. Gehen Daten hier verloren oder werden sie beschädigt, kann keine nachgelagerte Reparatur sie wiederherstellen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment