ИИ не видит середину? Обманите его структурой
Вы кидаете в нейросеть многостраничный PDF, задаёте вопрос по абзацу из середины, а она выдаёт бред или, хуже, уверенную галлюцинацию. Некоторые начинают шептать «магические фразы» или менять модель. Это не работает. В 2023 году вышла работа «Lost in the Middle» (Liu et al.), где чётко показано: трансформеры действительно хуже усваивают информацию из центральной части промпта. Это не баг, а статистическое свойство механизма внимания — начало и конец имеют перевес, середина тонет. И это воспроизводится на разных моделях.
Решение Раз уж физику архитектуры не переписать, меняем тактику. Никаких заклинаний — только инженерия. 1. Фрагментация. Длинный документ = серия коротких запросов. Никогда не пихайте всё сразу. 2. Периферийное размещение. Самые важные факты (цифры, даты, имена) должны стоять либо в самом начале вашего составного промпта, либо в самом конце каждого блока. 3. Иерархическое сжатие. Сначала просите ИИ сделать выжимку по каждой части, затем — выжимку по выжимкам. Так вы выносите «слепое пятно» за скобки.
Примеры ❌ Как не надо: «Вот контракт на 70 страниц, найди условие о форс-мажоре на странице 35». Модель с вероятностью 70% проигнорирует нужный кусок. ✅ Как надо: «Вот страницы 1–15 — перечисли все упоминания форс-мажора. Вот страницы 16–30 — сделай то же самое. … Теперь, имея список всех упоминаний, ответь, есть ли пункт о штрафах при форс-мажоре».
Пример промпта (можно копировать): «Раздели документ на смысловые фрагменты по ~2000 токенов. Для каждого фрагмента создай краткую аннотацию со всеми числами и датами. Затем, используя только эти аннотации, дай ответ на мой вопрос. Вопрос: …»
ИИ — не гуру, а статистический экстраполятор. Чтобы он не терял суть, не прячьте суть в середине — кладите её на видное место.
А вы ловили нейросеть на том, что она пропускала очевидный факт из середины вашего длинного промпта? Как диагностировали?