Хватит нести бред про миллион токенов
Я заебался это слушать. Каждый релиз модели - новое окно на 1кк, и каждый раз находится кто-то, кто выдает: теперь можно не думать о контексте.
Нельзя. Больше 200к пихать в модель бессмысленно, и это не просто мой опыт. Умные дядьки все посчитали.
В июле я про это уже писал: Тогда это опиралось на мой опыт, без единого пруфа. На днях поспорил в чате, услышал, что представления у меня устаревшие, и полез за пруфами. Собрал сильно больше, чем ждал😅
Lost in the middle, 2023 год Стэнфордская статья, с которой все началось. Модели дают вопрос и пачку документов, а нужный двигают - в начало, в середину, в конец. Выходит U-образная кривая: края модель использует, середину теряет.
Но самое прикольное даже не это. Когда нужный документ лежал в середине, GPT-3.5 отвечал ХУЖЕ, чем когда ему вообще не давали документов. Контекст в этой позиции не бесполезен, а даже вредит.
И вторая находка: модели с расширенным окном показали ровно те же цифры, что и базовые. Уже в 2023 измерили - окно побольше не значит, что модель им пользуется.
Context Rot, 2025 год Отчет Chroma на 18 моделях - Claude 4, GPT-4.1, Gemini 2.5. Отсюда термин.
Главное: деградация - это НЕ переполнение окна. Модель начинает врать задолго до лимита и на тривиальных задачах.
• чем меньше вопрос буквально совпадает с ответом - тем быстрее падение качества • на перемешанном тексте модели работают даже лучше, чем на связном
Почему так
Внимание - это распределение фиксированной суммы. Модель раскладывает 100% внимания по всем токенам окна: чем их больше, тем меньше достается каждому. Между 8к и 256к разница в 32 раза. Плюс училась она на коротких текстах - двухсоттысячную позицию почти не видела. Отсюда и края: начало с концом конкуренцию выигрывают, середина проигрывает.
И главное - у модели нет адресной памяти. Она не достает факт, а размазывает по нему внимание вместе со всем остальным мусором. Поэтому хорошим поиском это не лечится, измерено отдельно: даже когда модель извлекает все нужное идеально, качество падает на 13.9-85%.
Самое демонстративное LOCA-bench, февраль 2026. Агенту дают задачу и раздувают вокруг него окружение, не трогая задачу. Точность по длине:
• Claude-4.5-Opus: 96% на 8к, 84% на 32к, 65% на 64к, 34% на 128к, 14.7% на 256к • GPT-5.2-Medium: 72%, 60%, 52%, 38.7%, 21.3% • Gemini-3-Flash: 64%, 40%, 36%, 21.3%, 17.3%
У Opus заявленное окно - 200к, и на 256к от него остается 14.7%. Причем мои 200к тут выглядят даже щедро. Половина точности теряется уже к 100к.
Самое свежее PredicateLongBench от NVIDIA, июль 2026. Модели совсем свежие - Opus 4.6, GPT-5.4, Gemini 3.1 Pro.
История повторяется: на сложных вариантах Opus 4.6 проваливается до 7%, а на самом тяжелом лучший результат - 10% у Gemini при 1% у Opus и GPT😑
Что с этим делать
Вывод ровно один: контекст надо не чистить, а не засорять.
Там же померили, что помогает при 128к: programmatic tool calling поднимает GPT-5.2 с 38.7% до 49.3%, context awareness тащит Gemini с 21.3% до 33.3%. А тупое удаление старого не дает почти ничего - очистка тулколлов +1.3 пункта, автокомпакция (привет, /compact) местами вообще в минус.
Что из этого делаю я:
• Одна сессия - одна задача. Не тянуть диалог, пока он не превратился в тыкву • План живет в файле, а не в диалоге. О чем и был пост про SDD • Progressive disclosure. Пусть агент сам сходит за информацией, когда понадобится • Никакой надежды на автокомпакцию. Померили на агентах: полный контекст 85.7%, он же со сжатием - 63.7%. Если использовать /compact - то только с указанием, что должно остаться
И перестаньте смотреть на чиселко максимального контекста при выборе модели. Его вам и так хватит.
Контроль контекста - не оптимизация и не тюнинг для задротов. Сейчас это ваша основная работа. Пока не поменяется архитектура моделей - придется приседать вокруг контекста руками.
Можете кидать этот пост любым приверженцам "А у X КОНТЕКСТ БОЛЬШЕ" - пусть спорят со мной в комментариях
В этом посте были ссылки, но мы их удалили по правилам Сетки