Проверяем не ответ, а обоснование.

🌡 Thermal‑Grounded Feedback (TGF): проверяем не ответ, а обоснование

Исследование 2608.09145 решает проблему: модели часто дают правильный вывод, но объясняют его неправильными причинами — например, в инфракрасных задачах ссылаются на цвет и форму, хотя должны на тепловой сигнал.

TGF не меняет сам ответ, а улучшает текст обоснования через цикл «оценка → правки → переписывание → выбор». В результате объяснение становится достовернее, а точность ответа остаётся прежней.


🔁 Как работает TGF (4 шага)

Шаг 1 — Judge (оценщик) Оценивает текущее объяснение по четырём критериям (0–3 балла): • Тепловая обоснованность (использует ли модель реальный тепловой сигнал) • Привязка к конкретному объекту/региону (не общие слова) • Отсутствие «штампов» (общих фраз без доказательств) • Калибровка уверенности (не завышена ли)

Выдаёт диагноз и итоговую оценку.

Шаг 2 — 4 Feedback‑агента (параллельно в одном запросе) Каждый агент вносит узкую правку: 1️⃣ Тепло: «добавь тепловое доказательство» 2️⃣ Привязка: «укажи конкретный объект/слайд» 3️⃣ Карантин штампов: «убери общие фразы» 4️⃣ Уверенность: «скорректируй уверенность»

Шаг 3 — Reviser Переписывает объяснение, учитывая все правки. Вывод остаётся прежним (например, «не инвестировать»).

Шаг 4 — Selector Сравнивает новую версию с оригиналом по иерархии критериев. Если не удовлетворяет — цикл повторяется.

> Ключевой момент: меняется только обоснование, ответ не трогаем.


📋 Как реализовать в одном промпте (шаблон)

> *Задача: {задача}* > *Ответ: {итоговый_вывод}* > *Обоснование: {текст_обоснования}*

> Шаг 1 (Judge): оценить по 4 критериям, вывести диагноз и итоговую оценку.

> Шаг 2 (Feedback‑агенты): > • Агент "Тепло": «добавь тепловое доказательство» > • Агент "Привязка": «укажи конкретный объект/слайд» > • Агент "Карантин штампов": «убери общие фразы» > • Агент "Уверенность": «скорректируй уверенность»

> Шаг 3 (Reviser): перепиши обоснование с учётом правок. Вывод {итоговый_вывод} НЕ МЕНЯЙ.

> Шаг 4 (Selector): сравни новую версию с оригиналом, выбери лучшую.

💡 Совет: если задача проще, можно сократить до 2 агентов (например, «точность данных» + «уверенность») и убрать условие «вывод не меняй», если это не критично.


📄 Пример из практики (оценка питч‑дека стартапа)

Исходные данные: Задача: *Стоит ли инвестировать в этот стартап?* Ответ: *Не инвестировать* Обоснование: *«Команда неопытная, рынок конкурентный, нет повторных покупок.»*

Шаг 1 (Judge): • Тепловая обоснованность: 0/3 (нет цифр) • Привязка: 1/3 (не указан слайд) • Штампы: 2/3 (общие фразы) • Уверенность: 2/3 (завышена) Итог: низкая надёжность объяснения.

Шаг 2 (Feedback): • Тепло: «Добавь конкретные метрики LTV, CAC, retention» • Привязка: «Укажи слайд 4 – финансовые показатели» • Карантин штампов: «Удали фразы "команда неопытная" и "рынок конкурентный" без цифр» • Уверенность: «Снизить уверенность до 60%»

Шаг 3 (Reviser): > *Не инвестировать. Обоснование: На слайде 4 показан LTV = $120, CAC = $80, retention = 30%. Эти показатели ниже порога прибыльности, а средний срок окупаемости превышает 5 лет.*

Шаг 4 (Selector): новое объяснение получает 3/3 по всем критериям → выбирается как финальное.


⚖️ Когда TGF полезен, а когда нет

Полезно: • Когда есть чётко разделённые источники (тепловое vs RGB) — модель может «подменить» источник, если оригинал недоступен. • Требуется проверка достоверности объяснения — метод выявляет штампы и неверные ссылки. • Ответ уже считается корректным — TGF не меняет вывод, только повышает прозрачность обоснования.

Не стоит использовать: • Ответ модели неверен по сути — метод ничего не исправит. • Задача не имеет раздельных источников (например, текстовый анализ без визуальных данных). • Ограничения по времени — требуется несколько раундов общения с моделью.