论文

校准底线:格式修复可以伪装成中小型规模的自我校正

The Calibration Floor: Format Repair Can Masquerade as Self-Correction at Small-to-Mid Scale

模型评测模型行为与机制分析

摘要

语言模型自我修正后的准确性变化通常被解释为推理的变化。我们证明这可能会在答案提取边界处失败,并通过因果关系而不是仅通过观察来测试失败。在 Qwen3.5 (0.8B-9B)、Gemma-4-12B 和通过 API(腾讯 Hy3、Nvidia Nemotron-3-Ultra-550B)在 29 个主单元和一个前沿臂中的两个前沿模型中,我们将始终修正的精度转变分解为内容边际(两者的答案都可解析)和格式恢复/损失边际(可解析性变化)。在具有有意义的不可解析答案率的 12 个单元格上,格式影响超过内容影响 (Wilcoxon p=1.7e-3)。为了测试这一因果关系,我们通过语法约束解码强制已经生成的推理,以便每个答案都可以通过构造进行解析:在 14 个单元中,这缩小了朴素总效应和内容边缘估计之间差距的中值 71%,其中两个单元完全收敛,并且报告而不是忽略了两个最大效应单元的残差。集群模型证实,底层规模 (0.8B/2B) 模型发生内容级别变化和危害的几率远高于能力规模模型 (p<1e-7)。在 Qwen3.5 上逐字复制所引用的置信门协议并不能重现其报告的增益,并且显示出相同的接近于零的内容裕度。对更大模型的前沿检查显示,格式主导地位随着规模的扩大而增强:尽管总效应高达+0.275,但所有 5 个单元的内容裕度恰好为零,尽管该臂的功率较低。内容裕度上的校准下限标准揭示了一种挤压:下限尺度单元有净空但信号不足,能力尺度单元有信号但净空很小;只有一个细胞勉强存活,密封保留增益可以忽略不计。在该领域衡量的自我纠正中,内容只占一小部分。我们发布工具、代码和导出结果。