Мы намерили красивых цифр про "совет экспертов": латентный дебат в 67 раз быстрее текста, +51% на адаптивных вопросах. А потом честно выписали, что реально проверено - и нашли дыру размером с весь продукт.
Мы ни разу не оцифровали сеньора из расшифровки собеседования. Мерили механизмы на крохотной 0.5B и синтетике, а главного - не делали. Сегодня чиним.
Gemini-3 играет "Петра" - сеньора с жёсткой рубрикой: ценит конкретный инцидент и цифры, жаргон без единого разобранного сбоя штрафует. Он собеседует кандидатов разной силы и честности, включая умелых блефёров, и выносит вердикт: Индекс 0-100, оценки по навыкам, красные флаги.
Как он докапывается - отдельное удовольствие. Кандидат: "поднял партиции на лету, лаг ушёл". Пётр: "спорно, это ломает порядок по ключу и гарантирует ещё более долгий ребаланс". На слово не верит.
Дальше дистилляция: пары "стенограмма → вердикт" скармливаем крошечному LoRA на RTX 3090, чтобы судил как Пётр. Метрика простая и злая - held-out F1: совпал ли двойник с живым сеньором на кандидатах, которых не видел.
Грабли дня: reasoning-модель то и дело отдаёт почти-JSON - хвостовая запятая, кавычка без экранирования, парсер падает, запись теряется. Прикрутили sanitizeJsonStringBeforeParse, чинит перед разбором.
Дорогая модель нужна ровно на один раз - сгенерировать данные. Судить будет двойник на карте за копейки в час.