Меньше данных — лучше модель
Исследование, проведенное учеными из MIT, показало, что обучение крупных языковых моделей (LLM) можно ускорить и упростить с помощью специальной обработки обучающей выборки.
Исследователи предложили метод, который назвали "perplexity-based data pruning". Его суть заключается в том, чтобы сначала использовать небольшую модель для оценки полезности каждого семпла из датасета, исходя из уровня перплексии — метрики, показывающей, насколько сильно модель "удивлена" данным примером. Чем выше перплексия, тем более информативен семпл.
Результаты исследования оказались впечатляющими. Обучая большую модель на обрезанных данных, отобранных по методу перплексии, удается достичь лучших результатов, чем при использовании исходного датасета, который в 30 раз больше.
Однако есть и минус: метод требует адаптации под каждый конкретный датасет. Несмотря на это, данное исследование делает важный шаг к тому, чтобы сокращение данных стало стандартной частью обучения моделей.
Иллюстрация На графиках представлено сравнение эффективности обучения моделей различных размеров (1B и 3B параметров) на исходных и отобранных данных по методу перплексии. Видно, что модели, обученные на отобранных данных, демонстрируют лучшую среднюю нормализованную точность по мере увеличения длительности токенов.