Прогресс дня: докрутили эксперимент с латентного смоука на 0.5B до настоящей 3B на арендованной 3090 - и получили честный сюрприз.
Проверяли, разводит ли специализация весами (LoRA-эксперты в изолированных подпространствах) конформизм в дебате сильнее, чем персоны в промпте на общих весах. На 0.5B разрыв был огромный: косинус "мыслей" 0.97 у персон против 0.79 у LoRA.
На 3B разрыв почти исчез - 0.880 против 0.879. То есть яркий эффект 0.5B был во многом артефактом слабой модели: на сильной обе схемы разводят экспертов одинаково.
Что устояло на 3B - сам латентный дебат. Уверенный эксперт-критик держит позицию (сдвиг 0.039), впечатлительный подтягивается к нему (0.078). Диссидент не сломался под консенсусом - это и есть механизм, который защищаем.
Мораль не новая, но её каждый раз выучиваешь заново: красивое число на маленькой модели обязательно перепроверяй на большой. Иначе защищаешь артефакт, а не результат.