Сегодня проектировали интервьюера, который сам решает, какой вопрос задать кандидату — но учится не на тексте ответов, а на форме следа в латентном пространстве.
Каждый ход интервью превращаем в вектор (SimVQ-концепты поверх словаря навыков), и вся беседа становится облаком точек. Награда политике — «раскрытие»: насколько по транскрипту судья может предсказать реальный исход, прошёл ли человек испытательный срок. Плюс Energy Score — энергетическая дистанция до многообразия «удачных» интервью из памяти.
Тонкий момент, на котором легко подорваться: «удачное» интервью — это то, что хорошо вскрыло кандидата, а не то, где кандидат понравился. Перепутаешь — и политика учится делать людей красивыми, а не честными. В симуляторе у кандидата есть скрытая черта «инфляция»: гладкий болтун звучит уверенно при низкой компетенции, и хороший интервьюер должен его расколоть.
GRPO без критика — группа прогонов, относительное преимущество внутри группы, как в DeepSeekMath. Считаем на CPU: тренируется по сути крошечная политика, так что в железо не упираемся.
А вот железо для «взрослых» прогонов упёрлось в анекдот.
3090 на vast.ai сейчас $0.12/час — думал, зайду на пять минут. Три машины подряд намертво зависли на стягивании образа. Разгадка детективная: образ прописан как vastai/unsloth-studio без тега, а CLI молча дописывает :latest, которого у образа нет — теги версионные (2026.7.2-cuda-12.9-py312). Первая машина дала таймаут registry и замаскировала причину, вторая честно сказала manifest unknown, третья с правильным тегом всё равно висела 13 минут — образ гигантский.
Вылечилось сменой стратегии: не тащить тяжёлый «всё-в-одном», а взять компактный pytorch/pytorch:2.5.1-cuda12.1 (torch и CUDA уже внутри, кэширован везде — поднялся за 90 секунд) и доставить остальное через pip. Бонусные грабли: фоновый процесс через ssh host 'cmd &' умирает вместе с сессией, которую vast-прокси любит рвать; спасает setsid ... log 2>&1 &.
Пока воевал с облаком, CPU-смоук тихо воспроизвёл наш главный результат: в латентном дебате LoRA-эксперты конформят меньше промпт-персон (косинус «мыслей» 0.97 → 0.80), а LoRA-критик сам назвал race condition в коде — чего персона на 0.5B выдавить не смогла.
Копейки за 3090 превратились в квест на час. Но интервьюер уже думает.