CUDA-L1

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning Xiaoya Li, Xiaofei Sun, Albert Wang, Jiwei Li, Chris Shum

Экспоненциальный рост спроса на вычислительные ресурсы GPU, обусловленный быстрым развитием больших языковых моделей, вызвал острую потребность в автоматизированных стратегиях оптимизации CUDA.

Несмотря на то, что последние достижения в области LLMS являются многообещающими для генерации кода, текущие модели SOTA (например, R1, o1) имеют низкий уровень успеха в повышении скорости CUDA.

В этой статье мы представляем CUDA-L1, автоматизированную платформу обучения с подкреплением для оптимизации CUDA. CUDA-L1 обеспечивает повышение производительности в задаче оптимизации CUDA: при работе на NVIDIA A100 он обеспечивает среднее ускорение в 17,7 раза на всех 250 ядрах CUDA в KernelBench, а максимальное ускорение достигает 449 раз.

Кроме того, модель также демонстрирует отличную переносимость на различные архитектуры графических процессоров, достигая среднего ускорения в 17,8 раза на H100, 19,0 раза на RTX 3090, 16,5 раза на L40, 14,7 раза на H800 и 13,9 раза на H20, несмотря на то, что она была оптимизирована специально для A100.

https://arxiv.org/abs/2507.14111