Реальные истории из сопровождения AI Production GigaCode
Замечательный доклад прочитал Владислав Кинякин, руководитель направления сопровождения AI Production в GigaCode на Agentic Coding Митап.
1. Одна задача пользователя = до сотни запросов к нейросети. Агент думает, вызывает инструменты, ошибается, пробует снова. Это не REST API, это бесконечный цикл.
2. RPS (запросы в секунду) больше не главная метрикаВажнее доля сессий, где был хотя бы один сбой. Таких обычно на порядок больше, чем ошибочных запросов. И именно они создают очередь в поддержку.
3. Скорость убивает не нагрузка, а аппетит агента. Задачи становятся сложнее, контекст разрастается: с 10к токенов в начале до 150к в середине сессии. P99 по времени до 5 минут ожидания.
4. Одна ошибка на 15-м шаге стирает 14 предыдущих. В вебе обновил страницу и забыл. Здесь теряются минуты работы пользователя и дорогое GPU-время.
5. Одинаковое железо только на бумагеНа двухкарточных нодах с PCIe обмен между GPU тормозит декодинг. Балансировщик не знает об этом и льёт трафик равномерно очередь растёт, латентность ползёт вверх.
6. HTTP 200 ни о чём. Надо смотреть на очереди, KV-cache, TTFB и retries. Если пользователь не получил результат мы не ОК, даже если все запросы вернули 200.
📊 Главный вывод: За 2025 год 60 млрд токенов. За 30 дней 2026-го уже 1,8 трлн. 🚀Рост дикий, инженеры Сбера молодцы, что вывозят.