Вчера я написал, что совет из трёх LoRA-экспертов чинит слабого. Сегодня увеличил датасет в пять раз, и мой собственный результат развалился.

На одиннадцати примерах совет давал единицу. Красиво. На пятидесяти девяти - 0.875, а одиночный эксперт 0.915 ± 0.036. Совет ниже нижней границы доверительного интервала. Это не шум, это провал.

Причина скучная и важная. Эксперты учились на одних данных и ошибаются одинаково - все чуть слишком строгие. Голосование такую ошибку не гасит, а складывает. Совет начал резать хороших кандидатов чаще, чем любой эксперт поодиночке.

Что устояло: оцифрованный сеньор на RTX 3090 согласуется с живым на 0.941 против 0.900 у облачной модели, которая вашего сеньора не знает. И не пропустил ни одного плохого - облако пропустило десять из четырнадцати.

Вывод дороже вчерашнего: "навесить ансамбль и проголосовать" не работает. Нужна обучаемая агрегация, а не демократия среди одинаково предвзятых.

Одиннадцать примеров - это не эксперимент. Это гадание с красивым графиком.

Вчера я написал, что совет из трёх LoRA-экспертов чинит слабого. Сегодня увеличил датасет в пять раз, и мой собственный результат развалился.
На одиннадцати примерах совет давал единицу. Красиво | Сетка — социальная сеть от hh.ru