论文

张量核的操作员感知混合精度公差校准

Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels

模型评测评测方法与指标

摘要

大多数张量核正确性测试都会通过手工挑选的绝对和相对公差进行固定形状的全封闭式检查。阈值在整个语料库中复制,很少重新访问。我们从累积的云 GPU 跨 26 个条目的 gpuemu 语料库和 2 个数据类型(8,076 个结果行)运行中挖掘每个测试用例的元素错误分布。然后我们问一个经验问题:在正确的实现下观察到的内核本身的绝对容忍度是多少?答案比当前精心挑选的 atol 严格得多。最大的紧缩是attention_triton fp16,$2{,}184\times$。仅限于语料库为其提供配对的正确对应项的 7 个 LLM 型 Buggy 变体,校准的每个(op、dtype)容差将 bug 检测召回率从 73.2%(2,467 中的 1,805)提高到 82.4%(2,467 中的 2,034),绝对增益为 9.3 个百分点(+229 个新检测)。在 1,882 例正确对照病例中,对照假阳性计数从 0 例上升到 20 例(+1.1 个百分点)。