Один LoRA-эксперт - это лотерея.
Обучили трёх на одних и тех же данных, отличались только сиды. Первый и второй согласились с живым сеньором идеально. Третий пропустил двух блефёров из трёх.
Тот же рецепт. Тот же датасет. Разброс - как повезёт.
Совет из этих же трёх, простым голосованием, сработал на уровне лучшего и починил слабого: блефёров пропущено ноль.
Вот зачем нужен совет. Не чтобы выжать лишние проценты у сильного эксперта, а чтобы убрать провал у слабого. В найме цена ошибки - двенадцать окладов, и "как повезёт" тут не работает.
Всё крутится на одной RTX 3090 внутри контура. Облачная модель, которая вашего сеньора не знает, набрала заметно меньше.
Данные предварительные: held-out всего 11 примеров, три блефёра. На такой выборке единица - это не "идеально", это шум. Гоним датасет в пять раз больше и доверительные интервалы.