论文

LLM 生成的 GPU 内核中的正确性错觉

The Correctness Illusion in LLM-Generated GPU Kernels

模型评测评测方法与指标

摘要

LLM 生成的 GPU 内核的基准(KernelBench、TritonBench、GEAK)通过固定形状、小样本全封闭式检查对正确性进行评分。输入数量因基准而异。每个内核的形状、dtype 和容差都是固定的。我们根据经验测试该预言。我们构建了一个由 24 个 Triton 和 CPU 替代内核组成的受控语料库(15 个正确的控制和 9 个 LLM 风格的 bug 变体,其中包含记录的转录错误),并在具有高精度(fp64)CPU 参考和每个(op、dtype)绝对容差的操作模式感知种子模糊测试下重新评估它。种子预言机标记了 9 个有缺陷的内核中的 9 个,并通过了 15 个正确控制中的 15 个,控制精度成本为零。我们将语料库扩展到 26 个操作(添加 flash-attention 对),并在五个 GPU 类别(RTX 3060、A10、L40S、A100 SXM4、H100 NVL)上重新运行相同的协议。所有 5 个 GPU 的结论都是相同的:10 个错觉中有 10 个被捕获,16 个控制中有 16 个干净。语料库结果是关于 LLM 风格的转录错误,这些错误被 allclose-on-one-shape 预言机证明是正确的,而不是关于任何特定部署的 LLM 的错误率。每个标记的故障都会从存储的种子中逐字节重放。