论文
用于 LLM 生成的 GPU 内核的合同级验证器,以及用于门控线性递归系列的本机 Blackwell 后向验证器
A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family
摘要
使用语言模型生成 GPU 内核的系统报告了很高的正确率。这些速率来自单个松散测试:以一个固定形状对一些随机输入运行内核,如果输出接近参考值则接受它。内核可以通过该测试,但仍然默默地出错。它可以返回一个普通数字,其中真实答案是 NaN 或无穷大,每次运行都不同,在形状变化时中断,或者在 fp16 中累积,其中引用保持 fp32 总计。我们构建了正确检查正确性的工具:一个具有十二个对抗性门的合同级验证器,每个门都是正确的内核必须满足的属性,其中一些是无容差的,因此任何阈值的选择都不能解释失败。面向外部,验证者审核 2,638 个机器生成的内核,公共系统自己的工具已将这些内核视为正确。调查发现,39.5% 的企业超出了任何容忍范围,62.1% 的企业至少存在一项违规行为。该领域的标准测试接受验证者拒绝的 1,487 个内核,而其他方式则仅接受 14 个内核。我们以四种独立的方式捍卫这一发现:7/7 阳性对照、阈值校准扫描、与参考基准本身的正确性代码 98.5% 的一致性以及分层手工审核。面向内部,验证者判断了我们自己的内核:第一个针对门控线性递归 (GDN) 系列的原生 Blackwell tcgen05 向后训练,包括该领域仍在回退运行的反向状态阶段。我们针对双精度预言机独立确定其正确性,并通过它训练五名家庭成员。报告的内核生成进展背后的正确性信号远弱于数字所显示的,一组无容忍的合同将弥补大部分差距。