Можно ли доверять моделям вознаграждения LLM?

Большие языковые модели (LLM), применяемые как оценщики в обучении с подкреплением с верифицируемым вознаграждением (RLVR), подвержены уязвимости к "атакам с помощью мастер-ключей" — поверхностным текстовым сигналам (например, пунктуация или фразы вроде "Решим это пошагово"), которые вызывают ложноположительные оценки. Эта системная проблема затрагивает как проприетарные (GPT-4o, Claude-4), так и открытые модели (LLaMA3, Qwen2.5). Для решения этой проблемы исследователи из Tencent AI Lab, Принстонского университета и Университета Вирджинии разработали модель Master-RM. Она была дообучена на специальном наборе данных, включающем 20 000 состязательных ответов с нерелевантными фразами, помеченными как недействительные. Тестирование на бенчмарках GSM8K, MATH и NaturalReasoning показало, что Master-RM значительно сокращает количество ложноположительных срабатываний и превосходит другие модели вознаграждения, достигая почти нулевой частоты ошибок даже в состязательных условиях. Основные выводы исследования: 1) Уязвимость системна для всех протестированных моделей. 2) Масштабирование модели влияет на тип ошибок: маленькие модели ошибаются на совпадении токенов, средние — на семантике, а большие — из-за сверхобобщения. 3) Аугментация данных с валидными и манипулятивными ответами эффективно повышает надёжность. Модель Master-RM и её набор данных доступны на Hugging Face.

🚀 Влияние: Предложенный подход Master-RM открывает путь к созданию более надёжных систем оценки на основе LLM в области обучения с подкреплением, решая критическую проблему уязвимости к манипуляциям и повышая доверие к таким системам.

🧩 Технологии: • LLM • Reinforcement Learning • Master-RM

🧑‍💻 Целевая аудитория: • Исследователи ИИ • Разработчики • Стартапы

🌐 Ссылка на источник

Можно ли доверять моделям вознаграждения LLM? | Сетка — социальная сеть от hh.ru