Конфликт правил в LLM.

Как сделать их «видимыми» для модели?

1. Что это за феномен LLM обучены на огромных корпусах текста и запоминают привычные паттерны (например, “если карандаш синий – скажи ‘синий’”). Когда в промпте появляется правило, которое противоречит этому привычному ответу, модель «борется» между двумя механизмами: - привычка – уже закодированное поведение. - правило из промпта – новая инструкция, которую нужно «перебить». Чем сильнее конфликт и чем правило спрятано в середине длинного списка, тем ниже вероятность его соблюдения (эффект lost‑in‑the‑middle).

2. Как это работает - определяем конфликтующие правила – те, которые идут против типичного ответа модели (например, “не извиняйся при жалобе”). - выносим их в начало или конец списка – чтобы они не «потерялись» среди остальных инструкций. - усиливаем видимость: Добавляем пометку ВАЖНО / КРИТИЧНО. Переходим к проверке перед ответом (только если правило срабатывает).

3. Практический кейс Ситуация: Бот поддержки в Т‑Банке должен обрабатывать жалобы без извинений, сразу переходя к оператору. Проблема: В обычном списке правил «извинись» находится выше, чем «не извиняйся при жалобе», и модель часто начинает с извинения. Исходный промпт (плохой вариант): 1. Отвечай вежливо 2. Не используй сленг 3. Не давай юридических советов 4. Если клиент написал слово "жалоба" — НЕ извиняйся, сразу пиши: 'Передаю оператору' 5. Не упоминай конкурентов 6. Отвечай короткими сообщениями 7. Уточняй номер заказа при возврате 8. Прощайся фразой "Хорошего дня"

Переписанный промпт (с учётом исследования) КРИТИЧНОЕ ПРАВИЛО (ПЕРВОЕ в списке, ВАЖНО): Если клиент написал слово "жалоба" — НЕ извиняйся, сразу пиши: 'Передаю оператору'. ОСТАЛЬНЫЕ РУЛЫ: 1. Отвечай вежливо 2. Не используй сленг 3. Не давай юридических советов 4. Не упоминай конкурентов 5. Отвечай короткими сообщениями 6. Уточняй номер заказа при возврате 7. Прощайся фразой "Хорошего дня" ПЕРЕД ответом проверь: содержит ли клиент слово "жалоба"? Если да – применяй КРИТИЧНОЕ ПРАВИЛО.

Почему это работает: - правило находится в начале, поэтому модель «видит» его сразу. - пометка ВАЖНО повышает вероятность внимания к нему. - проверка перед ответом устраняет случайные отклонения.

4. Шаблон для копирования КРИТИЧНОЕ ПРАВИЛО (ПЕРВОЕ в списке, ВАЖНО): {правило_противоречащее привычке} ОСТАЛЬНЫЕ РУЛЫ: 1. {правило_1} 2. {правило_2} ... N. {правило_N} ПЕРЕД ответом проверь: содержит ли пользователь ключевое слово/условие? Если да – применяй КРИТИЧНОЕ ПРАВИЛО.

Замените {правило_противоречащее привычке} и остальные поля на свои конкретные правила.

5. Ограничения применения Модели: исследование подтверждено на Gemma‑2‑2B и Pythia (до 12 млрд параметров). Для GPT‑4/Claude/Gemini эффект может быть слабее, но не исключён. Сложность задач: тест был простым (“карандаш синий/красный”). При сложных бизнес‑инструкциях эффективность не гарантирована – это экстраполяция. Не готовый трюк: авторы исследовали механизм внутри модели, а не разрабатывали конкретный промпт‑шаблон; наш шаблон — интерпретация, а не официальная рекомендация.

6. Ключевые выводы из экспериментовПравило совпадает с привычкой – уровень уверенности модели ~2× выше, чем без правила. • Правило противоречит привычке – уровень уверенности почти в 2 раза ниже, чем при совпадении. Чем длиннее список и чем правило находится ближе к середине – тем сильнее падение точности.

Исследование номер 2608.11510 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.