С последним днем июля! ⚙ Посмотрим, что он нам принес: Airflow 3.3, Arrow 25 и Spark 4.2

6 июля вышел Apache Airflow 3.3.0. Расширили работу с партиционированными assets: несколько входных партиций можно свести в одну или развернуть одну в несколько. wait_policy позволяет запускать зависимый DAG после появления всех ожидаемых партиций, либо их заданного количества. Также появилось хранилище состояния задач и assets между повторами и запусками.

10 июля вышел Apache Arrow 25.0.0. При записи Parquet фильтры Блума теперь корректируются с учетом фактической кардинальности данных и заданной доли ложных срабатываний. На некоторых платформах их вычисление ускорено за счет векторизации. IPC reader стал строже, а Python-интерфейсы Feather объявлены устаревающими в пользу Arrow IPC.

14 июля вышел Apache Spark 4.2.0. В Data Source V2 добавили интерфейс CDC и конструкцию CHANGES для пакетного и потокового чтения изменений. Также появились управление транзакциями для коннекторов и эволюция схемы при INSERT. Arrow-оптимизированные Python UDF и обмен данными через Arrow теперь включены по умолчанию.