Оценка уверенности в LLM

Как заставить модель честно признаться, что она не знает.

LLM переоценивают уверенность в 78% случаев, когда их просят дать оценку по шкале. Особенно это заметно на задачах классификации: скоринг рисков, оценка тональности, модерация контента. Проблема не в том, что модель врёт, а в том, что стандартный подход («дай ответ и оценку уверенности») заставляет её защищать первое решение вместо взвешенного сравнения альтернатив. Авторы предлагают **Calibrated Reflection** — метод, который заставляет модель оценить все варианты шкалы, пройти через рефлексию и перекалибровать уверенность с учётом расстояния между возможными ответами.

Три шага, которые меняют правила игры

Весь метод помещается в один промпт, но делает три важные вещи: 1. **Оценка всех вариантов** — модель не выбирает один балл, а для каждого значения шкалы (например, от 1 до 5) оценивает вероятность, что оно правильное. Появляется таблица вероятностей вместо одного числа. 2. **Рефлексия через самокритику** — для каждого балла модель сначала даёт первичную оценку, потом перепроверяет себя (не переоценила ли, не недооценила ли), и только потом финализирует вероятность. Это заставляет её искать контраргументы. 3. **Дистанционная калибровка** — итоговая уверенность пересчитывается с весами: ошибка на соседнем балле (например, 4 вместо 5) штрафуется слабо, ошибка через всю шкалу (1 вместо 5) — сильно. Вес = 1 / (1 + расстояние до выбранного балла). **Важно:** все шаги выполняются за один вызов модели, дополнительных API-запросов не нужно.

Как это выглядит на практике

Задача: оценить отзыв на маркетплейсе по шкале полезности от 1 до 5. **Промпт (сокращённая версия):** ``` Ты – эксперт по оценке качества отзывов покупателей. Шкала полезности: 1 – бесполезен (спам, нет деталей) 2 – слабо полезен (мало конкретики) 3 – средне полезен (есть детали, но однобоко) 4 – полезен (конкретные факты, плюсы и минусы) 5 – максимально полезен (детально, объективно) Вот отзыв: «Кроссовки пришли быстро, размер в размер, но подошва после недели носки начала отклеиваться. За свою цену – так себе, для дома норм, для активного использования не советую.» Для КАЖДОГО балла от 1 до 5: 1. Первичная оценка: почему этот балл может быть правильным? 2. Рефлексия: перепроверь себя. 3. Финальная оценка и вероятность (0-1). Выведи таблицу: | Балл | Вероятность | Затем выбери балл с макс. вероятностью и посчитай калиброванную уверенность. ``` **Что получим на выходе:** | Балл | Вероятность | |------|-------------| | 1 | 0.05 | | 2 | 0.10 | | 3 | 0.20 | | 4 | 0.40 | | 5 | 0.25 | Финальный балл: 4 Калиброванная уверенность: **68%** Обычная оценка уверенности «в лоб» выдала бы 90-95% и не показала бы, что модель колеблется между 4 и 5. В примере вероятностная масса сконцентрирована на верхней части шкалы, и калибровка оставляет уверенность на уровне 68% — это честный сигнал, что ответ требует человеческой проверки.

Готовый шаблон для ваших задач

Скопируйте и заполните поля: ``` Ты – эксперт по оценке {объект оценки}. Шкала: {описание шкалы с расшифровкой каждого балла от X до Y} Материал для оценки: {текст/контент} Для КАЖДОГО балла шкалы сделай: 1. Первичная оценка: почему этот балл может быть правильным? 2. Рефлексия: перепроверь рассуждение – нет ли переоценки или недооценки? 3. Финальная оценка после рефлексии. 4. Вероятность (0–1), что этот балл правильный. Выведи таблицу: | Балл | Вероятность | Затем: 5. Выбери балл с максимальной вероятностью. 6. Посчитай калиброванную уверенность: для каждого балла i вычисли вес W(i) = 1 / (1 + |i - финальный_балл|), калиброванная уверенность = сумма(вероятность_i × W(i)) / сумма(вероятность_i). Выведи финальный балл и калиброванную уверенность в процентах. ``` Адаптируйте под свою задачу — просто вставьте это в чат с LLM и ответьте на её уточняющие вопросы про шкалу и материал.

Продолжение в комментарии.