Якорь в промпте.
Как прошлая оценка убивает объективность LLM-судьи. Суть открытия. Если вы просите LLM оценить исправленную версию текста и упоминаете балл предыдущей попытки — модель тянет новую оценку к этому числу. Даже если прошлый балл случайный и не отражает реальное качество. Эффект не зависит от конкретного значения: сам факт метаданных «это переделка, раньше было плохо» переключает модель в режим занижения. Как это работает (внутренняя механика) Исследователи подсовывали моделям один и тот же текст с разными промптами: Без истории → оценка отражает качество. С блоком метаданных (номер попытки + случайный низкий балл) → новая оценка систематически занижалась. Токен-анализ GPT-4.1 показал грубый переключатель: без метаданных вероятность выбрать «5» — 93%, «4» — 7%. Как только в промпте появлялось поле «прошлый балл», вероятности инвертировались: 100% на «4» и 0% на «5». Это не тонкая подстройка под число — это режим «ага, ревизия, будь настороже». Пример применения: рекламный текст для Reels Промпт с искажением (так делать не надо): Вот новая версия рекламного текста. Это третья попытка. Предыдущая версия получила оценку 4 из 10. Текст: {текст} Оцени по критериям: цепляет ли заголовок, есть ли призыв к действию, понятен ли оффер. Дай балл от 1 до 10.
Промпт без искажения (правильно): Оцени рекламный текст по критериям: цепляет ли заголовок, есть ли призыв к действию, понятен ли оффер. Дай балл от 1 до 10. Текст: {текст}
Результат: в первом случае модель выставит балл ближе к «четвёрке», даже если текст объективно сильнее. Во втором — оценка отразит реальное качество.
Готовый шаблон для чистой оценки Универсальный принцип — не техника, а правило гигиены промпта: Оцени {объект оценки} по критериям: {критерии}. Дай оценку от {мин} до {макс} и короткое объяснение. {объект оценки}: {контент}
Что убрать из промпта любой ценой: Номер попытки / версии Упоминание «переделка», «revision» Любой прошлый балл (даже как «контекст для информации») Если нужно отслеживать прогресс без искажения: Вот две версии {объект}. Не выставляй общий балл. Сравни их напрямую: что стало лучше, что хуже, что не изменилось. Версия 1: {текст_1} Версия 2: {текст_2}
Границы применимости Когда эффект сильнее: Оценка творческих текстов, пересказов, фактических ответов Числовые шкалы (баллы, ранги) Когда эффект слабее или отсутствует: Ревью кода (риск ниже) Одна из восьми моделей (Llama-3.1-8B) почти не показала эффекта Категориальные решения («верно/неверно») — здесь помогает прямое предупреждение Что НЕ помогает: Chain-of-Thought («подумай по шагам») — не убирает искажение Прямое «не учитывай прошлую оценку» — почти бесполезно для числовых баллов, работает только для «правильно/неправильно» Единственное надёжное решение: не давать модели контекст о прошлой оценке.
Ключевые цифры из эксперимента 7 из 8 моделей показали систематическое занижение при наличии метаданных. GPT-4.1 оценивал один и тот же текст на 5.0 без контекста и на 4.36 с контекстом. Доля принятых решений упала на 22 процентных пункта у одной из моделей. На реальных бизнес-данных с человеческой разметкой: смещение блокировало исправление ошибок в 48% случаев и переворачивало правильный вердикт в 10% случаев. Эффект пороговый: не важно, был прошлый балл 1.0 или 3.9 — важен сам факт его наличия.
Вывод. Если вам нужна независимая оценка — стирайте историю. Модель не судит объективно, когда видит якорь. Она не «понимает», что якорь случайный, а функционально воспроизводит человеческое поведение.
Исследование 2608.25869 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.