Пятница, конец рабочей недели. Что это значит? Время новостей!

Чуть больше месяца назад Apache Gluten и Apache Polaris стали проектами верхнего уровня Apache Software Foundation — важное событие для экосистемы big data.

Polaris особенно примечателен: он наконец-то предлагает единую реализацию каталога данных для Spark, Trino и Flink. Это открывает путь к настоящему многодвижковому Iceberg — без костылей и дублирования. А ведь раньше приходилось поддерживать два параллельных каталога и писать утилиты для их синхронизации — крайне неудобное решение. Надеемся, Polaris быстро зарекомендует себя и перейдет в продакшн-использование. Кто уже пробовал его на своих кластерах? Делитесь впечатлениями!

Gluten, в свою очередь, позволяет существенно ускорить вычисления в Spark. Интересно, сколько времени можно сэкономить при построении еженощного ETL-пайплайна из 11 тысяч задач?

Радует и развитие Apache Iceberg: в превью вышла версия 3, которая включает deletion vectors (удаление строк без перезаписи файлов), поддержку новых типов данных и — барабанная дробь! — построчный линедж. Теперь можно отследить историю появления каждой строки на физическом уровне — это огромный шаг вперед для аудита, дебага и управления качеством данных. Интересно, как скоро каталоги данных начнут полноценно работать с этой функцией?

А еще DataFold опубликовал подробный лонгрид о технологиях с открытым исходным кодом. Отличный повод проверить, не устарел ли твой стек, и понять, что сейчас в тренде. Спойлер: да, AI на пике, но без качественных данных он никуда не денется. Поэтому роль платформ данных только растёт.