Открыли бенчмарк ИИ-агентов на российских облаках
Вопрос, который слышим от каждого второго заказчика из госсектора и банков: «Нам можно только российское. Какая модель реально работает, а не в презентации?» Теперь можно не спрашивать, а посмотреть: https://vibepilot.ru/benchmark Что внутри: 1 198 реальных задач за 3 месяца: договоры Word, сметы, Excel с формулами, лендинги. 22 сбоя на всех. 1,8%. В индустрии для агентов без конвейера называют 12–37%. YandexGPT 5 Pro: 1,2% сбоев, 4,4 ₽ за задачу. Alice AI LLM: 2,4%, 2,6 ₽. Все модели крутятся в Yandex Cloud и SberCloud, данные не уходят за периметр. Плюс «забег»: одна задача, две модели, параллельно, один конвейер. Вчера сайт стоматологии YandexGPT 5 Pro собрал за 1:25, Qwen3-235B за 4:51. Смотреть чужие забеги можно без регистрации. Секрет не в моделях, а в том, что конвейер забирает у модели структуру и проверку, оставляя ей только думать. На слабых моделях это разница между «работает» и «упало на третьем шаге». Кому нужен ИИ-агент строго на российской инфраструктуре: пишите, прогоним вашу задачу.