论文
LEAP:通过 GPU 内核生成中的代码 RL 的自适应修剪实现精益环境反馈
LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
摘要
后训练 大语言模型 (LLM) 通过强化学习 (RL) 具有显着先进的代码生成功能。为了绕过批评者网络的大量内存占用,当前最先进的框架利用了无批评者范例,例如与基于规则的验证沙箱相关的组相对策略优化(GRPO)。然而,将这些框架应用于底层系统编程(例如 CUDA 内核生成)会带来严峻的挑战:二进制通过/失败奖励会引入严重的信号稀疏性,而多轮环境反馈循环会遭受令人望而却步的编译延迟和跨轨迹的奖励稀释。在这项工作中,我们引入了 LEAP(通过自适应修剪的精益环境反馈),这是一种可扩展且计算高效的多轮强化学习框架,针对底层硬件加速器对齐进行了优化。 LEAP 具有难度条件修剪 (DCP) 功能,这是一种动态门控机制,可以自适应地从多轮扩展中切断简单和过于灾难性的任务,将资源密集型编译和硬件探索专门集中在高价值、复杂的任务上。为了在无需手动超参数工程的情况下完全操作这些路径,我们提出了基于排名的奖励公式。通过从 GRPO 轨迹组内的成对锦标赛结果中得出无标度相对优势,我们的方法本质上惩罚了简单提示上的词元低效率,同时最大化了具有挑战性的分布上的学习梯度。实证评估表明,LEAP 实现了卓越的首轮熟练度和强大的多轮调试弹性,同时比未剪枝的多轮基线收敛得更快,为底层代码 RL 建立了实用范例。