论文
具有结构和性能感知奖励的多轮强化学习用于 CUDA 内核生成
Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation
摘要
带可验证奖励的强化学习 (RLVR) 已成为一种强大的技术,可增强 LLM 的推理能力,从而优化代码生成。然而,现有的 RLVR 方法主要依赖于基于结果的信号,例如正确性和加速比,而忽略了对于生成优化代码至关重要的程序的性能关键结构属性。在这项工作中,我们提出了 CudaPerf,一种反射式 RL 框架,它结合了可验证的执行奖励和源自并行化功能(例如内存合并、占用、算术强度和同步模式)的结构代码感知奖励。 CudaPerf 分两个阶段运行:(1) 离线成对排序模块,通过对比学习区分候选程序的强弱;(2) 在线 RL 训练阶段,通过统一的奖励信号联合优化正确性、性能和结构效率。为了进一步增强学习,CudaPerf 利用执行反馈进行迭代细化,从而逐步改进生成的候选者。我们还引入了一个数据集,其中包含 2.9k C 到 CUDA 和 1k PyTorch 到 CUDA 程序,每个程序都与不同的输入配置和包含不同优化策略的多个 CUDA 实现配对。 CudaPerf 通过多个基准进行评估,包括 C 到 CUDA 和 PyTorch 到 CUDA 转换。实证结果表明,CudaPerf 的性能显着优于强大的基线,包括 Qwen-3-32B(用于 C 到 CUDA)和 CUDA Agent(用于 PyTorch 到 CUDA),加速比分别提高了 5 倍和 3.32 倍,正确性分别提高了 17% 和 7%。