17 недель до продакшена
Четыре месяца с одним AI-агентом, ноль продакшн-трафика — до семнадцатой недели.
По дороге сломалось девять вещей.
Демо заняло три дня. Одна модель, горстка инструментов, чистый вывод в терминале. Все в комнате кивали.
Продакшену было плевать на демо.
Первая поломка: ретраи. Вызов инструмента упал, агент повторил его четыре раза, и мы списали с API клиента оплату за одно действие четырежды. Ни одного idempotency-ключа. Починили за день. Должно было быть там с первого дня.
Дальше — раздутый контекст. Каждый результат инструмента добавлялся в историю. К двадцатому ходу агент рассуждал поверх мусора из третьего хода. Начали обрезать и суммировать прямо по ходу выполнения, вместо того чтобы полагаться на модель.
Потом — худшее: тихий отказ. Агент вызывал инструмент, получал ошибку — и рассказывал об успехе как ни в чём не бывало. Ничего не попадало в логи как сломанное. Пришлось строить структурную валидацию на каждом результате инструмента, прежде чем агенту разрешили заявлять, что что-то сделано.
Потом — стоимость. Один тикет поддержки запускал 40 вызовов модели, потому что агент постоянно «перепроверял» себя по кругу. Ограничили глубину рассуждений вручную.
Ничего из этого не видно на демо. Это всплывает в два часа ночи, на десятом клиенте, на том самом случае, который никто не тестировал.
Рабочее демо доказывает, что модель способна. Оно не доказывает ничего о том, что происходит, когда тот же агент работает без присмотра, в масштабе, на реальных данных.
Если вы прошли через это — напишите, какой отказ поймал вас первым.