Перестаньте тащить всю историю переписки в промпты ваших AI-агентов 🤦‍♂️

Как сегодня устроено 99% agentic-фреймворков (привет, ReAct, AutoGen и местами LangGraph)? На каждом шаге агент выполняет действие, получает ответ от среды и бережно... прилепляет весь этот лог к истории сообщений.

В итоге к 50–100 шагу агент: — Жрёт миллионы токенов на ровном месте (квадратичная сложность по контексту O(T^2)). — Ловит отравление контекста — путается в собственных старых рассуждениях и устаревших фактах. — Залипает в галлюцинациях на 5–15 шагов, если данные в среде изменились, а в старом логе написано обратное.

Исследователи из Google и Purdue выкатили пейпер, где предлагают перестать заниматься ерундой и вспомнить базовую теорию конечных автоматов.

💡 Суть идеи:

Выкинуть бесконечную простыню истории диалога на помойку и перейти к явному мутабельному стейту.

На каждом шаге модель получает ровно три вещи: 1️⃣ Неизменяемую спецификацию навыка (инструкции/правила). 2️⃣ Текущий структурированный стейт (компактный JSON: открытые PR, статус тестов, проверенные гипотезы). 3️⃣ Последнее наблюдение из среды.

Модель внутри шага думает (полноценный Chain-of-Thought), формирует действие и выдает state_patch (что обновить или удалить в JSON-стейта). Рантайм валидирует и накатывает патч на стейт, а все промежуточные рассуждения тут же удаляются. В следующий шаг они не идут.

📊 Что это даёт в цифрах (тестировали на Gemini 3 Flash): 🔵 Промпт не растет: размер контекста строго фиксирован O(1), а суммарный расход токенов масштабируется линейно O(T), а не квадратично. 🔵 Экономия бюджета: на горизонте в 100 шагов в бенчмарке склада SKILL.state потратил 65k токенов против 1 062 000 токенов у классического стейтфул-подхода (экономия в 16 раз при более высокой точности — 0.94 против 0.91). 🔵 0 шагов на восстановление: при внезапном изменении проекта обычные агенты галлюцинируют 5–14 шагов, пытаясь переварить противоречие в истории. SKILL.state обновляет JSON с первого же алерта без задержек. 🔵 Бенчмарки: на реальных задачах в терминале Linux (InterCode CTF) модель подняла метрику Pass@1 до 54.2% (против 41.8% у LangGraph) и срезала расход токенов на 65.9%, потому что банально перестала по кругу пробовать одни и те же упавшие команды.

👉 Первоисточник: SKILL.state: Scalable Long-Horizon Agent Skills

Перестаньте тащить всю историю переписки в промпты ваших AI-агентов 🤦‍♂️
Как сегодня устроено 99% agentic-фреймворков (привет, ReAct, AutoGen и местами LangGraph)? На каждом шаге агент выполняет дейст... | Сетка — социальная сеть от hh.ru