Где на самом деле узкое место
Крупная корпоративная платформа на своей ежегодной флагманской конференции (более 50 000 очных участников, свыше 122 000 подключившихся онлайн, из более чем 150 стран) представила архитектуру для ИИ-агентов в бизнесе, построенную на четырёх слоях: данные и контекст, бизнес-логика и права доступа, сами агенты и интерфейс, через который к ним обращаются люди и другие агенты. Компания также показала специализированную модель, обученную на синтетических сценариях, собранных из почти тридцати лет отраслевой практики работы с клиентами, без использования данных самих клиентов, — по собственным данным вендора (что требует независимой проверки), она допускает втрое меньше ошибок, чем модели общего назначения, на внутреннем тесте компании. Главный тезис презентации: долгосрочное преимущество достаётся не самой мощной модели, а тому, кто выстроил вокруг неё доверенные данные, права доступа, управление и возможность отвечать за результат.
Похожий вывод звучит в разборе голосовых ИИ-агентов для гостиничного бизнеса. Пилотный голосовой бот, отвечающий на звонки в отель, обычно быстро окупается — до 40–60% звонков в отели сегодня остаются без ответа, а свежий опрос почти 250 владельцев и операторов отелей показал, что больше половины по-прежнему испытывают нехватку персонала, а около 6 из 10 путешественников уже предпочли бы разговор с ИИ ожиданию на линии. Но дальше рост упирается в плато, которое автор разбора называет «потолком ресепшн-бота» — и его причина не в качестве голоса или распознавания речи, а в отсутствии инфраструктуры под ним: общего контекста о госте и номере, координации между узкими под-агентами, управляемого доступа к системам бронирования и явно прописанных границ — что агент решает сам, что только с одобрением человека, а что не решает никогда. Пример расчёта из разбора: отель на 150 номеров с 120 звонками в день и 40% упущенных при возврате половины звонков и конверсии в 15% получает около 1 170 долларов в день дополнительной выручки, а снижение доли ошибочных действий с 3% до 0,5% при 10 000 исполненных действий в месяц экономит от 37 до 100 тысяч долларов в месяц.
Третий материал проверяет тот же вопрос эмпирически, на стороне самих моделей. Исследование сравнило пять моделей от трёх разных поставщиков в связке с тремя разными оркестрирующими контурами — от простого реактивного цикла «думай-действуй» до контура с явным планированием и проверкой результата — на наборе сложных многошаговых задач. Разрыв в точности между простым и продуманным контуром составил от 14 до 28 процентных пунктов в зависимости от способа подсчёта (55,8% против 83,7% на одном из срезов). У топовой модели внутри одного из трёх протестированных семейств этот разрыв на сложных задачах оказался не меньше, а больше, чем у более слабых моделей того же семейства — то есть предположение «чем мощнее модель, тем меньше ей нужна внешняя структура» на этих данных не подтвердилось, хотя автор разбора прямо предупреждает: общий закон для всех моделей и всех типов задач из одного эксперимента не выводится.
Три независимых источника — из корпоративного ПО, гостиничного бизнеса и академического бенчмаркинга — сходятся в одном: возможности самой модели или бота перестают быть узким местом раньше, чем кажется. Дальше решает то, что вокруг неё: данные, которым можно доверять, явные правила о том, кто и что может делать, и постоянная проверка результата.