Инженер по обработке данных создает и поддерживает инфраструктуру, которая перемещает и хранит данные. Он пишет конвейеры обработки данных, управляет базами данных и обеспечивает доставку данных туда, куда они нужны, вовремя и в пригодном для использования виде. Специалисты по анализу данных и аналитики используют результаты работы инженеров. Если конвейер обработки данных выходит из строя, их работа останавливается.
Эта роль расширилась по мере роста объемов данных. Первые инженеры данных управляли реляционными базами данных и ETL-скриптами. Современные работают с облачными платформами, распределенными системами обработки данных и потоковыми системами. Они пишут код на Python, Scala или Java. Они глубоко разбираются в SQL. Они умеют проектировать схемы, разделять таблицы и оптимизировать запросы. Они также занимаются операциями: мониторингом, оповещениями и восстановлением в случае сбоя в 3 часа ночи. Эта работа — отчасти разработка программного обеспечения, отчасти администрирование баз данных, отчасти сантехника. Она не гламурная. Но она необходима. Специалист по обработке данных, который тратит половину своего времени на исправление неработающих конвейеров, не занимается наукой о данных. Хороший инженер данных решает эту проблему. Конвейеры работают. Данные чистые. Аналитики и ученые могут сосредоточиться на своей основной работе.
Обязанности инженера по обработке данных
- Создание конвейеров обработки данных — извлечение, преобразование, загрузка данных
- Управление хранилищем данных — базами данных, озерами данных, хранилищами данных.
- Обеспечение надежности — мониторинг, оповещение, восстановление.
- Оптимизация производительности — настройка запросов, секционирование.
- Поддержка потребителей — аналитиков, ученых, разработчиков приложений.
Инженеры по обработке данных строят дороги. Все остальные по ним ездят. Когда дороги хорошие, никто этого не замечает.
Comments
No comments yet. Be the first to share a thought.
Leave a comment