У нас новый запрос от банка Data Engineer Чем предстоит заниматься: Проектировать и разрабатывать ETL/ELT-пайплайны и витрины данных для аналитики и ML-моделей. Выполнять очистку, валидацию и стандартизацию данных, настраивать автоматические проверки качества. Организовывать сбор и переливку данных в Data Lake, контролировать обновление и актуальность. Оптимизировать SQL-запросы и пайплайны. Поддерживать Airflow-DAG-и, CI/CD и документацию. Внедрять современные инженерные практики и автоматизацию. Взаимодействовать с DS и аналитиками, помогать в оптимизации SQL и Python-кода. Что ожидаем: Отличное владение SQL (PostgreSQL, PL/SQL) и глубинное понимание теории БД. Python + библиотеки для данных: pandas, polars, PySpark, pyarrow. Опыт работы с Airflow, DVC. Практика с распределёнными системами данных: Greenplum, Hadoop, Hive, Impala, HDFS. Знание архитектур DWH, Data Lake, Data Mart. Навыки работы с Jupyter (notebook/lab/hub), Git, CI/CD. Опыт оптимизации SQL и профилирования. Будет преимуществом: Docker / Kubernetes. Опыт взаимодействия с ML/DS-командами, построение data-пайплайнов под модели. Инструменты проверки качества данных (Great Expectations, OpenMetadata и др.).
Локация/Гражданство: РФ писать t.me/apozdneev ждём ваших специалистов
· 13.04
Data Engineer для банка с ML-фокусом - это всё более распространённый запрос, где инженер данных не просто строит пайплайны, а понимает downstream потребности DS-команды. Сочетание Airflow + PySpark + Greenplum - классический стек для банковского DWH, а DVC как инструмент версионирования данных и моделей - хороший сигнал, что в банке уже выстраивают MLOps-практики, а не просто хранят данные.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён