Пять экспертов. Трое систематически строгие, двое точные. Голосование просто считает голоса - трое побеждают. Совет выдал 0.875: хуже, чем любой из них поодиночке.

Дело оказалось не в экспертах, а в том, как склеиваются их мнения. Дали им пересмотреть вердикт, увидев остальных, - 1.000.

Через день наткнулся на свежую статью (Kong et al.): SFT даёт модули, а RL должен выучить routing - то, как модули склеиваются. Ровно то место, куда мы уперлись. Приятно дойти самому, а потом найти теорию, которая объясняет почему.

Бизнес в том, ГДЕ спорить. Текстовый дебат - 8 секунд на раунд. Латентный, обменом скрытых состояний, - 122 миллисекунды. В 67 раз быстрее и вчетверо точнее по итоговому баллу.

8 секунд - это "подумаем и вернёмся". 122 миллисекунды - это пока кандидат договаривает фразу. Совет успевает поспорить и подсказать следующий вопрос прямо в разговоре.

Честно: гипотеза, что в латенте эксперт упрямее держится против большинства, не подтвердилась. Он выигрывает скоростью и точностью, а не упрямством.

Пять экспертов. Трое систематически строгие, двое точные. Голосование просто считает голоса - трое побеждают. Совет выдал 0.875: хуже, чем любой из них поодиночке | Сетка — социальная сеть от hh.ru