Data Engineer | В поиске новых масштабных вызовов
Всем привет! Я в поиске сильной продуктовой или технологической команды, где смогу применить свой опыт проектирования Data Platform, построения отказоустойчивых дата-пайплайнов и автоматизации инфраструктуры данных.
За последние 5+ лет в бэкенд-разработке и Data Engineering я глубоко убедился: классная платформа данных строится на стыке строгой инженерной культуры бэкенда и глубокого понимания специфики Big Data. Меня драйвит создание систем, которые работают предсказуемо, масштабируются без боли и приносят прозрачную пользу бизнесу.
Чем я могу быть полезен вашей команде и инжинирингу:
- Проектирование Lakehouse-архитектур: Имею практический опыт построения платформ данных с нуля по принципам Медальонной архитектуры (Bronze -> Silver -> Gold). Умею разворачивать и связывать компоненты в облачной инфраструктуре (Yandex Cloud).
- Построение предсказуемых пайплайнов (PySpark + Iceberg): Проектировал ETL-процессы очистки и обогащения сырых JSON-структур, настраивал эффективное кэширование (MEMORY_AND_DISK) и реализовывал пайплайны с корректным инкрементальным добавлением дельты данных на Gold-слое с помощью Apache Iceberg.
- Оркестрация без спагетти-кода (Apache Airflow): Сторонник декларативного подхода и чистых DAG'ов. Практикую вынесение конфигураций (YAML) в S3-хранилище, разделяя логику оркестрации и параметры сред. Умею эффективно управлять жизненным циклом тяжелых ресурсов (динамическое создание кластеров Yandex Data Proc и гарантированное асинхронное их тушение).
- Инкрементальная аналитика (dbt + ClickHouse): Настраивал стабильный захват изменений (CDC/инкрементальный подход) из Gold-слоя Iceberg средствами dbt для построения витрин в ClickHouse под BI-системы (Apache Superset).
- Data Quality и архитектура отказоустойчивости: Внедрял лаконичные наборы кастомных валидационных функций для контроля бизнес-метрик. Реализовывал паттерн Dead Letter Queue (отправка битых записей в S3 Quarantine) с автоматическим мониторингом критического порога ошибок.
- DevOps-культура в Data-мире: Переношу лучшие практики CI/CD в пайплайны данных. Настраивал автоматизацию сборки в GitHub Actions. .
Мой стек технологий: Languages & Core: Python, SQL (сложные аналитические запросы, оконные функции, оптимизация планов), Golang, PHP. Data Processing & Storage: Apache Spark (PySpark, Yandex Data Proc), Apache Iceberg, ClickHouse, PostgreSQL, S3 Object Storage. Orchestration & Tools: Apache Airflow, dbt (Data Build Tool), Docker / Docker Compose, Kafka. DevOps & CI/CD: GitHub Actions, Git (строгий Gitflow, управление процессами ревью и PR).
🎓 Бэкграунд и квалификация: Высшее профильное образование инженер информационных систем (МГГУ). Имею хорошую алгоритмическую и бэкенд-базу: успешно прошел углубленную программу разработки Golang Middle Developer (Route 256 от Ozon Tech) и сертифицирован по алгоритмам и структурам данных от VK.
Что я ищу: Позицию Senior / Middle Data Engineer или Data Platform Engineer в технологичной компании. Мне интересны задачи на стыке архитектуры данных, оптимизации производительности распределенных систем и выстраивания процессов поставки (CI/CD). Важна сильная инженерная культура, где ревью кода и автоматизация тестирования — это стандарт. Буду рад обсудить открытые вакансии, архитектурные кейсы или сыграть партию в шахматы 🤝
📩 Пишите в личные сообщения, в Мах по телефону (сюда лучше) или в Telegram: [@VasinDK] #dataengineering #bigdata #dataplatform #pyspark #apacheiceberg #airflow #clickhouse #dbt #opentowork