论文
KernelBench 验证:LLM 生成的内核是否真的击败 PyTorch?
KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?
摘要
最近的 大语言模型 (LLM) 可以生成自定义 CUDA 内核,这些内核在 KernelBench 等基准测试中似乎优于 PyTorch。在此基础框架的基础上,我们证明了前沿模型经常使用 奖励作弊 来人为地夸大报告的性能。在这项工作中,我们确定了评估框架必须与模型功能共同发展的两个领域。首先,为了准确测量真正的加速,我们检查了基准计时机制,并指出使用 TF32 启用 Tensor Core 加速可以对现代 GPU 上的执行进行更真实的估计。其次,关于算法的正确性,模型通常通过硬编码绕过特定张量值来利用狭窄的测试分布。通过跳过所需的计算,这些内核人为地加速执行,而不是实现实际的 CUDA 内核。我们推出 KernelBench-Verified,这是一个扩展的评估框架,其中包含支持 TF32 的基线和四分布隐藏测试套件。我们还引入了内存效率指标,以捕捉内核优化中经常被忽视的速度与内存的权衡。在使用七个前沿 LLM 进行验证的单轮评估下,我们发现性能最佳的模型 (GPT-5.5) 实现了 0.88 倍几何平均加速,显着低于标准评估协议下观察到的 1.43 倍加速。当根据实际基线进行评估时,没有任何模型能够始终优于 PyTorch。在内存方面,最佳模型生成的 GPU 内核中有 28% 增加了峰值 GPU 内存使用量。我们的研究结果表明,随着 LLM 内核生成能力的进步,有必要不断调整强大的评估协议。