论文

MusaCoder:在摩尔线程 GPU 上进行全栈训练的本机 GPU 内核生成

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU

模型训练强化学习

摘要

原生 GPU 内核生成将高级张量程序转换为可执行、高效的底层代码。现有的 大语言模型 (LLM) 很难完成这项任务,而基于执行的强化学习则受到奖励稀疏、奖励作弊 和训练不稳定的困扰。我们推出了 MusaCoder,这是一个用于在 CUDA 和 MUSA 后端生成本机 GPU 内核的全栈训练框架。 MusaCoder 通过 MooreEval(分布式验证器和奖励环境)结合了渐进式面向内核的数据合成、多样性保留拒绝 微调 和执行反馈强化学习 (RL)。为了稳定强化学习,MusaCoder 引入了用于首轮锚定多轮奖励的 PrimeEcho、用于从所有失败的硬样本中恢复信号的缓冲动态重试以及用于 离策略 序列过滤的 MirrorPop。 KernelBench 和 MUSA 移植变体上的实验表明,MusaCoder 在正确性和经验加速方面都优于强大的开源和专有基线,其中 9B 模型匹配或超过前沿闭源模型,27B 模型建立了新的技术水平。这些结果不仅证明了本机内核生成的全堆栈执行反馈训练的有效性,还证明了摩尔线程 GPU 支持完整 LLM 后训练 堆栈的能力,为大型 模型训练 和新兴加速器的优化提供了实用基础。