Заставили несколько LoRA-экспертов спорить не текстом, а скрытыми состояниями - и научились читать эти "мысли" обратно в текст.

Оценку senior-инженера выносит не один судья, а совет ролей: технарь, лидер, аудитор достоверности. Они обмениваются hidden state через обучаемую проекцию и пересматривают вердикты по ходу собеседования.

Что проверили честно, с контролями:

  • латент технаря и лидера декодируется на 89-95% против уровня монетки;
  • латент аудитора не декодируется вообще - не прячем;
  • дебат двигает оценку в нужную сторону (−7,2 ± 3,3, интервал не накрывает ноль), но прирост на решении мал: узкое место - точность экспертов, а не дебат.

И грабли: сырой hidden-state нельзя класть прямо в эмбеддинги, unsloth глобально патчит transformers, а max_new_tokens тихо обрезал отрицательные вердикты и выдал ложный Brier=0.

Код, цифры и диаграммы - в статье: https://iconicompany.com/blog/latent-debate-lora-experts-decoded

Заставили несколько LoRA-экспертов спорить не текстом, а скрытыми состояниями - и научились читать эти "мысли" обратно в текст | Сетка — социальная сеть от hh.ru