Заставили несколько LoRA-экспертов спорить не текстом, а скрытыми состояниями - и научились читать эти "мысли" обратно в текст.
Оценку senior-инженера выносит не один судья, а совет ролей: технарь, лидер, аудитор достоверности. Они обмениваются hidden state через обучаемую проекцию и пересматривают вердикты по ходу собеседования.
Что проверили честно, с контролями:
- латент технаря и лидера декодируется на 89-95% против уровня монетки;
- латент аудитора не декодируется вообще - не прячем;
- дебат двигает оценку в нужную сторону (−7,2 ± 3,3, интервал не накрывает ноль), но прирост на решении мал: узкое место - точность экспертов, а не дебат.
И грабли: сырой hidden-state нельзя класть прямо в эмбеддинги, unsloth глобально патчит transformers, а max_new_tokens тихо обрезал отрицательные вердикты и выдал ложный Brier=0.
Код, цифры и диаграммы - в статье: https://iconicompany.com/blog/latent-debate-lora-experts-decoded