Поговорим о технологиях и навыках, которые дата-инженеры в Т используют ежедневно, чтобы извлекать ценность из данных. Основа платформы данных — это Greenplum, Spark и Trino. Самыми многочисленными пользователями платформы являются продуктовые аналитики. Им важно уметь быстро проверять гипотезы, сравнивая их с прошлыми наблюдениями, оперативно реагировать на поведение клиентов. Для этого регулярно востребованные данные собираются в модель с бизнес-сущностями - DWH. Поэтому ключевой навык, необходимый нашим инженерам, — профессиональное знание SQL, причём сразу на нескольких диалектах. К списку технологий можно добавить средства доставки данных NiFi и Kafka. Типовые задачи дата-инженера включают: — моделирование и связывание данных из разных источников; — извлечение информации с помощью группировок, оконных и аналитических функций; — работу с версионностью данных. При решении задач дата-инженеры используют ключевые инструменты платформы: — Helicopter — ноутбучная среда для анализа данных и прототипирования; — TEDI — ETL-инструмент для разработки; — Chimera — система CI/CD для поставки изменений в продакшн. При разработке ETL-процессов необходимо учитывать и нефункциональные требования: сроки и гарантии доставки, объёмы данных, влияние на смежные процессы. Для этого важно: — применять на практике знания архитектур DataWarehouse (DWH) и DataLakehouse (DLH); — проектировать различные способы доставки данных в хранилище; — работать с суррогатными ключами, частичным обновлением и стратегиями хранения данных. Мы также уделяем большое внимание оптимальности выполнения запросов: при написании кода учитываем движок, на котором он будет выполняться, и используем практики оптимизации. Иногда без более сложной обработки данных не обойтись —её удобнее реализовать на императивном языке программирования. На помощь приходит Python и экосистема фреймворков вокруг него.