В упряжке должно быть легче.
Алиса AI теперь сама выбирает модель под задачу. То, о чем мы говорили какое-то время назад как важную задачу, таки свершилось. Простые запросы отправляются по быстрому маршруту, а для сложных автоматически включается режим «Эксперт» с более ресурсоёмкой моделью и агентным сценарием.
Решение принимает собственный роутер-классификатор: он анализирует запрос, оценивает необходимый объём ресурсов и выбирает подходящую конфигурацию. Сейчас около 80% запросов обрабатывает Alice AI LLM, а для «Эксперта» Яндекс тестирует и собственные, и open-weight модели на своей инфраструктуре.
Самое интересное здесь — модель лишь часть системы. Вокруг неё работает харнесс (так, ну тут без спекуляций вокруг термина, чуть позже напишу про это отдельно): системный промпт, инструменты, агентный цикл и управление контекстом. Модель сама решает, что делать дальше: например, сначала обратиться к Поиску, затем выполнить расчёт в Python и только после этого сформировать ответ.
С файлами логика похожая: текст извлекают парсеры, изображения и страницы PDF при необходимости анализирует VLM, а для больших документов используется RAG. Если готового инструмента не хватает, агент может написать и запустить собственный Python-скрипт.
Качество такой «упряжки» Яндекс измеряет на внутреннем «Сложном бенчмарке» из реальных многошаговых задач. Для каждой вручную задают положительные и отрицательные критерии, а результат оценивает model judge. Одна и та же GLM 5.2 high набрала 48 баллов с харнессом Яндекса и 43 с оригинальным от авторов модели.
Это хорошо дополняет недавнее интервью Валеры в Forbes:
Современный AI-продукт — уже не одна LLM, а ансамбль моделей, поиска и инструментов, и итоговое качество во многом определяется тем, как организована их совместная работа.
В этом посте были ссылки, но мы их удалили по правилам Сетки