Моделям дадут полный контроль над собственным контекстом?

Нашёл интересную работу исследователей Meta про Context Language Models. Обычно контекст агента устроен довольно просто: старая история плюс новый ответ. Со временем она разрастается, и её приходится отдельно сжимать или чистить.

В CLM модель сама управляет своим контекстом. Вся история хранится в обычном файле, доступном через Bash. Модель может удалять ненужные сообщения, заменять длинные фрагменты короткими заметками, сохранять важные результаты или полностью перестраивать содержимое. После каждого изменения файл становится новым контекстом.

Интересно, что никаких инструкций по управлению историей модели не давали. В экспериментах агенты сами начали ставить пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов.

В одном из тестов модель после 163 редактирований удерживала рабочий контекст в пределах 6–8K токенов. Авторы также отдельно обучили модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus результат вырос с 28,8% до 42,5%. При этом вычислений потребовалось на 38,8% меньше, чем у бейзлайна с обычной суммаризацией.

Есть и проблема: произвольное редактирование контекста ломает обычное кеширование. Если изменить середину истории, следующие состояния приходится пересчитывать.

Для этого авторы сделали Suffix Cache Reuse. Неизменившиеся части контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В результате серверные вычисления сократились ещё примерно на 35%.

На длинных задачах эффект особенно заметный: на 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении вычислений на 59%. В 24-часовом тесте по оптимизации кода результат оказался на 65% лучше бейзлайна при том же вычислительном бюджете.

Причём менять архитектуру LLM для этого не пришлось.

Моделям дадут полный контроль над собственным контекстом? | Сетка — социальная сеть от hh.ru