论文
Kernel-Smith:进化内核优化的统一方法
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
摘要
我们提出了 Kernel-Smith,这是一个用于高性能 GPU 内核和算子生成的框架,它将稳定的评估驱动的进化代理与面向进化的 后训练 配方相结合。在代理方面,Kernel-Smith 维护了一批可执行候选者,并使用性能最佳且多样化的程序档案以及有关编译、正确性和加速的结构化执行反馈来迭代改进它们。为了使这种搜索可靠,我们为 NVIDIA GPU 上的 Triton 和 MetaX GPU 上的 Maca 构建了后端特定的评估服务。在训练方面,我们通过保留正确性保持、高增益修正,将长期进化轨迹转换为以步骤为中心的监督和强化学习信号,从而使模型被优化为进化循环内强大的局部改进器,而不是一次性生成器。在统一的进化协议下,Kernel-Smith-235B-RL在Nvidia Triton后端的KernelBench上实现了最先进的整体性能,获得了最佳的平均加速比,并超越了Gemini-3.0-pro和Claude-4.6-opus等前沿专有模型。我们进一步验证了 MetaX MACA 后端的框架,其中我们的 Kernel-Smith-MACA-30B 超越了 DeepSeek-V3.2-think 和 Qwen3-235B-2507-think 等大规模同行,凸显了跨异构平台无缝适应的潜力。除了基准测试结果之外,相同的工作流程还为生产系统(包括 SGLang 和 LMDeploy)做出了上游贡献,证明 LLM 驱动的内核优化可以从受控评估转移到实际部署。