Перестаньте тащить всю историю переписки в промпты ваших AI-агентов 🤦♂️
Как сегодня устроено 99% agentic-фреймворков (привет, ReAct, AutoGen и местами LangGraph)? На каждом шаге агент выполняет действие, получает ответ от среды и бережно... прилепляет весь этот лог к истории сообщений.
В итоге к 50–100 шагу агент: — Жрёт миллионы токенов на ровном месте (квадратичная сложность по контексту O(T^2)). — Ловит отравление контекста — путается в собственных старых рассуждениях и устаревших фактах. — Залипает в галлюцинациях на 5–15 шагов, если данные в среде изменились, а в старом логе написано обратное.
Исследователи из Google и Purdue выкатили пейпер, где предлагают перестать заниматься ерундой и вспомнить базовую теорию конечных автоматов.
💡 Суть идеи:
Выкинуть бесконечную простыню истории диалога на помойку и перейти к явному мутабельному стейту.
На каждом шаге модель получает ровно три вещи: 1️⃣ Неизменяемую спецификацию навыка (инструкции/правила). 2️⃣ Текущий структурированный стейт (компактный JSON: открытые PR, статус тестов, проверенные гипотезы). 3️⃣ Последнее наблюдение из среды.
Модель внутри шага думает (полноценный Chain-of-Thought), формирует действие и выдает state_patch (что обновить или удалить в JSON-стейта). Рантайм валидирует и накатывает патч на стейт, а все промежуточные рассуждения тут же удаляются. В следующий шаг они не идут.
📊 Что это даёт в цифрах (тестировали на Gemini 3 Flash): 🔵 Промпт не растет: размер контекста строго фиксирован O(1), а суммарный расход токенов масштабируется линейно O(T), а не квадратично. 🔵 Экономия бюджета: на горизонте в 100 шагов в бенчмарке склада SKILL.state потратил 65k токенов против 1 062 000 токенов у классического стейтфул-подхода (экономия в 16 раз при более высокой точности — 0.94 против 0.91). 🔵 0 шагов на восстановление: при внезапном изменении проекта обычные агенты галлюцинируют 5–14 шагов, пытаясь переварить противоречие в истории. SKILL.state обновляет JSON с первого же алерта без задержек. 🔵 Бенчмарки: на реальных задачах в терминале Linux (InterCode CTF) модель подняла метрику Pass@1 до 54.2% (против 41.8% у LangGraph) и срезала расход токенов на 65.9%, потому что банально перестала по кругу пробовать одни и те же упавшие команды.
👉 Первоисточник: SKILL.state: Scalable Long-Horizon Agent Skills
· 12 ч
Я бы уже на 5 шаге задумался если бы не получил результат. Ресурсы не резиновые тем более локальные.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён