🐈 Кот, который гуляет по серверам MIT (и рвет бигтех)

Вышел отчет Marktechpost (ML Global Impact Report 2025), и там внезапно очень приятные цифры для отечественного IT. Библиотека CatBoost от Яндекса вошла в топ-5 неамериканских инструментов ML, наиболее часто упоминаемых в научных статьях по всему миру.

Немного сухой статистики, чтобы понимать масштаб: — CatBoost используется в каждой 30-й научной статье по ML в мире. — География: 51 страна, включая США и Китай. — Пользователи: MIT, Stanford, Harvard. — Доля в статьях: 13%. Это прямая конкуренция с XGBoost (15%) и LightGBM от Microsoft (10%).

Почему так, если из каждого утюга кричат про нейросети?

Потому что бизнес и наука — это не (всегда) генерация картинок с котиками или написание эссе. Намного чаще — это просто структурированные табличные данные. Кредитный скоринг, медицинская диагностика, предсказание погоды, ранжирование товаров — всё это задачи, где трансформеры часто избыточны или работают хуже, чем классический бустинг.

Главная фишка CatBoost, за которую его любят дата-сайентисты (и я в том числе) — это умение работать с категориальными признаками «из коробки». Название как бы намекает: Categorical Boosting. Не нужно мучиться с One-Hot Encoding и раздувать размерность данных до небес. Кинул сырые данные — получил автоматический умный препроцессинг. Ну и с переобучением борется отлично.

Я сам уже давно именно этот фреймворк предпочитаю другим ☕️

🐈 Кот, который гуляет по серверам MIT (и рвет бигтех)
Вышел отчет Marktechpost (ML Global Impact Report 2025), и там внезапно очень приятные цифры для отечественного IT | Сетка — социальная сеть от hh.ru