Почему голосование большинством часто «падает»?

Что это за метод?

* **Self‑consistency (SC)** — техника: задаёшь одной модели один и тот же вопрос несколько раз (до 64) в отдельных запросах, собираешь все ответы и берёшь самый частый. * Идея: случайные ошибки «сгладятся» при усреднении.

Как это работает

1. **Запрос** – задаём вопрос *N* раз (обычно 5–64). 2. **Сбор ответов** – сохраняем каждый вывод модели. 3. **Мажоритарное голосование** – выбираем наиболее частый ответ. 4. **Оценка** – сравниваем с первым ответом и, при желании, пытаемся предсказать, будет ли SC полезен, анализируя согласованность или «уверенность» модели (токен‑потенциалы).

Пример применения

> *Вопрос:* > “Уволили сотрудника по статье 81 ТК РФ без 2‑месячного предупреждения. Какую компенсацию ему положить сверх обычного расчёта?” **Шаг 1** – Запросить вопрос 5 раз в разных чатах. Что видим: 5 ответов, возможно разные варианты. **Шаг 2** – Считать частоту каждого ответа. Что видим: если 4 из 5 одинаковы – не гарантирует правильность. **Шаг 3** – Проверить согласованность токен‑потенциалов. Что видим: не даёт надёжного сигнала. **Вывод:** при сложных юридических/научных вопросах «уверенность» модели может быть ложной; лучше проверять цепочку рассуждений и сверяться с внешним источником.

Шаблон промпта (копировать)

``` [Вопрос] Пожалуйста, ответь подробно, включая шаги рассуждения. Если есть сомнения, укажи возможные альтернативы. ``` *Заполняй поле **[Вопрос]** конкретным запросом.*

Границы применимости

**Когда полезно:** • Простые/средние вопросы, где ошибки случайны (тесты «первый уровень»). • Маленькие модели 7–8 B без глубокого рассуждения. • Вопросы уровня выпускника вуза (биология, химия, физика). **Когда вредно:** • Сложные научные/правовые/медицинские задачи, где модель может «уверенно ошибаться». • Топ‑модели GPT‑5, Claude, o1 (не проверено). • Простой бытовой вопрос – эффект может быть обратным.

Ключевые выводы из экспериментов

* **Backfire**: во 70 % вопросов по химии SC ухудшает точность; биология — слабее; физика — умеренно. * **Согласованность ≠ точность**: у Llama‑3‑8B высокая согласованность часто совпадает с низкой точностью. * **Невозможно предсказать успех**: анализ токен‑потенциалов и согласованности не коррелирует с результатом SC. * **Потенциальный резерв**: теоретический «оракул» мог бы повысить точность на 14–17 % при оптимальном числе запросов, но это недоступно без внешней проверки.

Что делать (и что не делать)

• **Проверять цепочку рассуждений** – Рекомендация: Да – анализируй логику самостоятельно. • **Сверяться с внешним источником** – Рекомендация: Да – особенно при юридических/медицинских вопросах. • **Использовать SC на сложных задачах** – Рекомендация: Не рекомендуется без проверки. • **Определять «уверенность» по токен‑потенциалам** – Рекомендация: Не стоит полагаться; не коррелирует с точностью.

Итог

Self‑Consistency работает лишь тогда, когда модель *почти* права и ошибки случайны. На сложных вопросах она часто усиливает ошибку, «утопая» в неверном ответе. Поэтому для высокорисковых задач лучше полагаться на цепочку рассуждений и внешнюю проверку, а не на простое голосование.

**Номер исследования:** 2608.11403 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.