测量 Checker:GPU 内核基准预言机的突变分析
Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles
摘要
LLM 生成的 GPU 内核的基准通过一些随机输入和宽松的浮点容差来决定正确性,它们的结论现在提供给排行榜和强化学习奖励。最近的工作一致认为,这些检查器很弱,需要手动修补它们——额外的输入分布、模糊测试方法、更严格的容差——无法\emph{测量}任何修补程序是否足够。我们引入突变分析作为内核基准预言机的充分性指标:确定性规则将 10{,}303 个可编译错误注入到 188 个 KernelBench 问题的经过验证的 CUDA 实现中,其中 7{,}384 个问题具有独立的终止见证;任何测试协议均按其检测到的分数进行评分。官方检查未命中 \textbf{六分之一} 目击了错误(16.9%),确定性地,并且未命中的情况因族而异:8.7% 的算术错误逃逸,但 78.6% 的精度错误逃逸。该指标解释了原因(容差盲带随着大小的减小而增长;由合法浮点方差设置的输入攻击性的测量上限),审核最强的现有补丁(KernelBench-Verified 的增益从隐藏输入分成 $+4.0$ 点,从更严格的容差中分成 $+4.5$ 点,其作者无法计算这种分割),并公开了已发布的模糊测试方法,该方法拒绝 \emph{正确} 内核 107 次。在杀伤矩阵上优化套件达到 98.0% 的检测率,每个问题有两个输入(94.8% 保留),并且测量的故障分类法向测试生成器提供的信息比原始故障本身更多。在 48 个整体架构中,盲目性随着规模的扩大而增加,集中在深层同质管道中,并且有两个问题被证明是不可纠正的:它们的官方引用违反了基准测试本身对 fp64 的容忍度。我们将所有内容发布为 \href{this https URL}{KernelBench-M}。