Наш агент отвечал кандидату 28 секунд. Не думал 28 секунд - столько уходило, чтобы вообще начать думать.

Человек в чате за это время успевает уйти. Я решил, что дело в модели, и поменял движок: вместо Antigravity CLI поставил omp (Oh My Pi). Он работает и по токенам, и по подписке, а главное - умеет режим RPC, где агент живёт процессом и получает реплики кадрами, а не поднимается на каждую заново.

Стало 13 секунд на первый ответ и 2.5 на следующий. А в живом чате - по-прежнему 23 и 12.

Дело было в двух заголовках. Агент носит с собой токен человека и его последнюю реплику: по ней продукт сверяет, что цитата не выдумана. Оба меняются с каждым сообщением - а заголовки инструментов читаются один раз, при подключении. Каждое "привет" поднимало процесс с нуля. Я грел ровно то, что сам же и выбрасывал.

Починка - разделить. Движку выдаётся ключ на всю жизнь его процесса, а настоящие заголовки подставляет шлюз в момент вызова. 3.6 секунды на ответ в переписке.

Побочный выигрыш вышел дороже скорости: токен человека теперь не попадает в контейнер с моделью вовсе. А модель умеет запускать команды - и попросить её об этом может любой, кто пишет в чат.

Скоро откроем агента всем.