Оценка уверенности в LLM
Как заставить модель честно признаться, что она не знает.
LLM переоценивают уверенность в 78% случаев, когда их просят дать оценку по шкале. Особенно это заметно на задачах классификации: скоринг рисков, оценка тональности, модерация контента. Проблема не в том, что модель врёт, а в том, что стандартный подход («дай ответ и оценку уверенности») заставляет её защищать первое решение вместо взвешенного сравнения альтернатив. Авторы предлагают **Calibrated Reflection** — метод, который заставляет модель оценить все варианты шкалы, пройти через рефлексию и перекалибровать уверенность с учётом расстояния между возможными ответами.
Три шага, которые меняют правила игры
Весь метод помещается в один промпт, но делает три важные вещи: 1. **Оценка всех вариантов** — модель не выбирает один балл, а для каждого значения шкалы (например, от 1 до 5) оценивает вероятность, что оно правильное. Появляется таблица вероятностей вместо одного числа. 2. **Рефлексия через самокритику** — для каждого балла модель сначала даёт первичную оценку, потом перепроверяет себя (не переоценила ли, не недооценила ли), и только потом финализирует вероятность. Это заставляет её искать контраргументы. 3. **Дистанционная калибровка** — итоговая уверенность пересчитывается с весами: ошибка на соседнем балле (например, 4 вместо 5) штрафуется слабо, ошибка через всю шкалу (1 вместо 5) — сильно. Вес = 1 / (1 + расстояние до выбранного балла). **Важно:** все шаги выполняются за один вызов модели, дополнительных API-запросов не нужно.
Как это выглядит на практике
Задача: оценить отзыв на маркетплейсе по шкале полезности от 1 до 5. **Промпт (сокращённая версия):** ``` Ты – эксперт по оценке качества отзывов покупателей. Шкала полезности: 1 – бесполезен (спам, нет деталей) 2 – слабо полезен (мало конкретики) 3 – средне полезен (есть детали, но однобоко) 4 – полезен (конкретные факты, плюсы и минусы) 5 – максимально полезен (детально, объективно) Вот отзыв: «Кроссовки пришли быстро, размер в размер, но подошва после недели носки начала отклеиваться. За свою цену – так себе, для дома норм, для активного использования не советую.» Для КАЖДОГО балла от 1 до 5: 1. Первичная оценка: почему этот балл может быть правильным? 2. Рефлексия: перепроверь себя. 3. Финальная оценка и вероятность (0-1). Выведи таблицу: | Балл | Вероятность | Затем выбери балл с макс. вероятностью и посчитай калиброванную уверенность. ``` **Что получим на выходе:** | Балл | Вероятность | |------|-------------| | 1 | 0.05 | | 2 | 0.10 | | 3 | 0.20 | | 4 | 0.40 | | 5 | 0.25 | Финальный балл: 4 Калиброванная уверенность: **68%** Обычная оценка уверенности «в лоб» выдала бы 90-95% и не показала бы, что модель колеблется между 4 и 5. В примере вероятностная масса сконцентрирована на верхней части шкалы, и калибровка оставляет уверенность на уровне 68% — это честный сигнал, что ответ требует человеческой проверки.
Готовый шаблон для ваших задач
Скопируйте и заполните поля: ``` Ты – эксперт по оценке {объект оценки}. Шкала: {описание шкалы с расшифровкой каждого балла от X до Y} Материал для оценки: {текст/контент} Для КАЖДОГО балла шкалы сделай: 1. Первичная оценка: почему этот балл может быть правильным? 2. Рефлексия: перепроверь рассуждение – нет ли переоценки или недооценки? 3. Финальная оценка после рефлексии. 4. Вероятность (0–1), что этот балл правильный. Выведи таблицу: | Балл | Вероятность | Затем: 5. Выбери балл с максимальной вероятностью. 6. Посчитай калиброванную уверенность: для каждого балла i вычисли вес W(i) = 1 / (1 + |i - финальный_балл|), калиброванная уверенность = сумма(вероятность_i × W(i)) / сумма(вероятность_i). Выведи финальный балл и калиброванную уверенность в процентах. ``` Адаптируйте под свою задачу — просто вставьте это в чат с LLM и ответьте на её уточняющие вопросы про шкалу и материал.
Продолжение в комментарии.
· 2 ч
Когда метод работает (а когда нет) Полезен: Порядковые шкалы (1–5, 1–10, low-medium-high) — важно, чтобы между баллами было расстояние. Задачи с нечёткой границей — модерация отзывов, скоринг заявок, оценка релевантности. Ситуации, где цена ошибки разная — ошибка на соседнем балле приемлема, на дальнем — нет.
Бесполезен или вреден: Категориальные признаки — цвет, порода животного, тип продукта. Расстояние между категориями не имеет смысла. Длинные шкалы (10+ баллов) — промпт разрастается, становится дорого и медленно. Авторы рекомендуют 3–7 баллов. Если модель системно ошибается в логике оценки — метод калибрует уверенность, но не исправляет ошибки рассуждения. Если LLM стабильно ставит 5 спаму — калибровка не спасёт.
Что показали эксперименты Исследователи тестировали метод на трёх датасетах (HelpSteer2, Llama T-REx, проприетарный conversational) с моделями Claude-3-Haiku и Mistral-7B-Instruct. Ключевые выводы: Калибровка уверенности улучшилась на 18–25% по сравнению с прямой оценкой. Метод особенно эффективен на задачах, где правильный ответ не очевиден и модель изначально демонстрирует низкую уверенность. Рефлексия даёт основной прирост — без неё калибровка падает примерно на треть. Дистанционная калибровка оказалась чувствительной к выбору функции веса: формула 1/(1+d) показала лучший баланс, квадратичный вес сильнее штрафовал дальние ошибки, но иногда занижал уверенность на спорных случаях.
Проблема: LLM переоценивают уверенность в порядковых классификациях, защищая первый ответ. Решение: заставить модель оценить все варианты шкалы, пройти рефлексию и пересчитать уверенность с учётом близости альтернатив. Ограничение: только для порядковых шкал (3–7 баллов). Результат: честная оценка уверенности вместо иллюзии точности.
Технически метод простой — один промпт, один вызов модели, таблица вероятностей и формула пересчёта. Идеально для встраивания в пайплайны модерации, скоринга и оценки качества, где важно отличать уверенный ответ от случайной догадки.
Исследование https://arxiv.org/pdf/2609.04539 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён