Вознаграждения...
https://arxiv.org/pdf/2507.10532
Особенно удивительны случаи, когда случайные или некорректные сигналы вознаграждения приводят к повышению производительности. Однако подобные успехи чаще всего связаны с определёнными семействами моделей, такими как семейство Qwen2.5, а аналогичные эксперименты с другими моделями, например, Llama, показывают нестабильные результаты. Такое различие ставит вопрос о причинах подобной вариативности и надежности выводов, сделанных на основе стандартных эталонных тестов.
Наш анализ показывает, что сильные стороны модели Qwen2.5 в математических рассуждениях объясняются особенностями её предварительного обучения на обширных корпусах интернета, что потенциально создает риск загрязнения данных в традиционных наборах тестов. Например, такие известные тесты, как MATH-500, AMC и AIME, были изначально разработаны для проверки способностей студентов, а теперь используются для тестирования возможностей LLMs. Тем не менее, существование взаимосвязей между обучающими корпусами и стандартными наборами вопросов делает полученные результаты сомнительными.