Где токены, Лебовски?

ИИ-агенты обещают экономить рабочее время, но сами легко сжигают бюджет: повторно читают документы, вызывают лишние инструменты и иногда уходят в цикл. Поэтому цены миллиона токенов уже недостаточно — бизнесу важнее знать, сколько стоит выполненная задача.

О том, куда агент расходует токены и как удержать счет под контролем, нам рассказал руководитель Yandex AI Studio Артур Самигуллин. Почему агент обходится дороже обычного чат-бота? ➖ В чат-боте все просто: пользователь отправляет запрос, модель отвечает. У агента на такое общение приходится лишь около 10% потребления. Остальные 90% — его внутренняя работа: выбор и вызов инструментов, поиск в интернете и корпоративных системах, чтение документов, анализ результатов и планирование следующего шага.

Заранее предсказать длину этой цепочки трудно. По оценке сервиса Tokens per day, с января 2024 года мировой ИИ-рынок израсходовал 94,2 квадриллиона токенов, а сейчас расходует около 395 трлн в сутки. Один из главных ускорителей — распространение агентов.

Насколько они прожорливее на практике? ➖ На нашей платформе модели обрабатывают около 300 млрд токенов в месяц. Пока на агентов приходится около 15% запросов, но они уже потребляют около 30% всех токенов. По мере распространения агентских сценариев объем токенов будет кратно расти.

В августе 2026 года в DeepSeek V4 Flash на нашей платформе такими были 70% токенов.

Где агент начинает транжирить токены? ➖ Неоптимизированный агент может вызвать ненужную функцию, несколько раз целиком перечитать один документ или зациклиться. Иногда он отправляет сложной и дорогой модели задачу, с которой справилась бы более компактная.

Поэтому главная метрика — не цена токена и даже не их количество, а конечная стоимость выполнения задачи. Чтобы ее контролировать, компании нужны детальные логи: вся цепочка действий агента, расход на каждом шаге и причины, по которым он выбрал конкретный инструмент или модель.

Как снизить расход? ➖ Один путь — сначала решить реальные задачи большой моделью, а затем обучить на ее ответах более компактную. Другой — оптимизировать сам инференс: отдельно настраивать оборудование для обработки длинного запроса и генерации ответа, квантизировать модели, ускорять выдачу и переиспользовать уже обработанный контекст.

Для этого платформы вводят кэшированные токены. Если часть запроса повторяется, модель не вычисляет ее заново. В июле 2026 года в DeepSeek V4 Flash на нашей платформе такими были 75% токенов. Они в среднем в пять раз дешевле обычных и экономили пользователям несколько миллионов рублей в месяц. После обновления веб-поиск также стал расходовать в два-три раза меньше токенов: теперь он забирает не страницы целиком, а только релевантные фрагменты.

Универсальные агенты сделают счёт еще больше? ➖ Парадоксально, но для бизнеса он может сократиться. Сейчас разные ИИ-сервисы отдельно загружают файлы, корпоративный контекст и инструкции. Универсальный агент сможет работать с ними в одном окне и решать задачу единой цепочкой, не повторяя одни и те же операции.

Так развиваются Anthropic — от Claude Code к Cowork, OpenAI — от Codex к ChatGPT Work, и Yandex AI Studio. При этом рынок не сведется к двум-трем агентам «для всего». Останутся специализированные решения для юристов, врачей, архитекторов и других областей, — словом, всех тех, кому базовых возможностей ИИ будет уже не хватать.

@anti_agi

Где токены, Лебовски?
ИИ-агенты обещают экономить рабочее время, но сами легко сжигают бюджет: повторно читают документы, вызывают лишние инструменты и иногда уходят в цикл | Сетка — социальная сеть от hh.ru