Пять экспертов. Трое систематически строгие, двое точные. Голосование просто считает голоса - трое побеждают. Совет выдал 0.875: хуже, чем любой из них поодиночке.
Дело оказалось не в экспертах, а в том, как склеиваются их мнения. Дали им пересмотреть вердикт, увидев остальных, - 1.000.
Через день наткнулся на свежую статью (Kong et al.): SFT даёт модули, а RL должен выучить routing - то, как модули склеиваются. Ровно то место, куда мы уперлись. Приятно дойти самому, а потом найти теорию, которая объясняет почему.
Бизнес в том, ГДЕ спорить. Текстовый дебат - 8 секунд на раунд. Латентный, обменом скрытых состояний, - 122 миллисекунды. В 67 раз быстрее и вчетверо точнее по итоговому баллу.
8 секунд - это "подумаем и вернёмся". 122 миллисекунды - это пока кандидат договаривает фразу. Совет успевает поспорить и подсказать следующий вопрос прямо в разговоре.
Честно: гипотеза, что в латенте эксперт упрямее держится против большинства, не подтвердилась. Он выигрывает скоростью и точностью, а не упрямством.
· 13.07
Похоже что посты пишутся автоматически. :) не хватает агента на роль главного мультиомниканального редактора :)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён