论文
daVinci-kernel:通过 RL 进行协同进化技能选择、总结和利用,以实现 GPU 内核优化
daVinci-kernel: Co-Evolving Skill Selection, Summarization, and Utilization via RL for GPU Kernel Optimization
摘要
GPU 内核优化代表了一种范例,其中假定功能正确性,并且以执行效率为目标。我们提出了 daVinci-kernel,这是一个强化学习框架,它通过动态发展的技能库将技能发现与技能开发结合起来。 daVinci-kernel 联合训练共享一个 LLM 主干的三个代理:一个通过 BM25 和 LLM 重新排名检索相关技术的技能选择代理、一个根据选定技能生成多轮 CUDA/Triton 内核的策略代理,以及一个将成功执行轨迹提炼为可重用技能的技能摘要代理。仅在基于执行的验证确认可重现的加速后,才会添加候选技能。所有三个代理共享一个 LLM 主干,通过对多样性过滤数据的结构化 SFT 冷启动进行初始化,然后通过多轮 REINFORCE 和每个代理优势估计进行端到端联合优化。在 KernelBench 上,daVinci-kernel-14B 在 Fast$_1$ 阈值下的 Level 1、Level 2 和 Level 3 上分别达到了 37.2%、70.6% 和 32.2%,优于之前最强的 RL 训练模型 Dr\。内核 14B。