NVIDIA предложила ускорить генерацию роллаутов в GRPO с помощью спекулятивного декодинга

NVIDIA показала довольно приземлённый способ ускорить GRPO: спекулятивный декодинг для генерации траекторий. Поскольку именно этот этап съедает около 72% времени, идея с маленькой драфт-моделью, которая угадывает токены, а большая только проверяет, выглядит уместно, а не как очередной “AI magic”.

На Qwen3-8B получили до 1,77x в RL-Zero и 1,54x в RL-Think; лучше всего сработал прогноз трёх токенов, а пять уже начинали мешать. В симуляции с Qwen3-235B NVIDIA получила 2,5x. Но есть и холодный душ: весь шаг GRPO так не ускорить, потому что log-prob и оптимизатор остаются почти такими же дорогими. Еще один практичный штрих — драфтер предлагают дообучать прямо по ходу GRPO, чтобы он не отстава...

Источник: Data Science by ODS.ai

Все новости: ai.popovs.tech

#NVIDIA #LLM #AI


В этом посте были ссылки, но мы их удалили по правилам Сетки