Как я получил большой опыт в терминале Linux
Недавно у нас появилась необходимость организовать процесс управления пайплайнами данных в изолированной среде — так называемом "песочном контуре". Задача была не из лёгких, но именно она помогла мне (и, уверен, поможет и вам) прокачаться в терминале Linux и разобраться сразу с двумя мощными инструментами дата-инженера: Apache Airflow и Pentaho Data Integration (PDI/Kettle).
📚 Что я сделал: 📦 Развернул окружение с Airflow и PDI в контейнерах (Docker вам в помощь).
🔧 Настроил базовую инфраструктуру: volume'ы, сети, переменные окружения.
🚀 Прописал entrypoint’ы и скрипты запуска, чтобы всё поднималось и работало без лишних танцев с бубном.
🔗 Связал их друг с другом: теперь можно запускать PDI-джобы из Airflow DAG’ов и контролировать весь процесс ETL централизованно.
🧪 Протестировал пайплайны, настроил логи, убедился, что отваливается всё красиво, с логами и без потери состояния.
📚 Зачем это всё:
Теперь каждый из нас может: ⦁ Писать и запускать свои DAG'и в Airflow; ⦁ Вызывать PDI-трансформации и джобы прямо из этих DAG'ов; ⦁ Гибко оркестрировать ETL-процессы и смотреть, что где падает/работает; ⦁ Делать это в безопасной песочнице, не опасаясь за продуктив.
————————
В общем, если хочешь по-настоящему понять, как связаны оркестрация, контейнеры и ETL-инструменты — просто попробуй поднять этот стек сам. А терминал — твой лучший друг на этом пути 😉
Постараюсь оформить небольшой гайд — пишите, если интересно!