论文

最后一句话常常胜出:腐败研究思想链中的一种混乱形式

The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies

模型评测评测方法与指标

摘要

损坏研究是评估思想链 (CoT) 忠实性 的标准工具,可根据步骤损坏时的准确性损失来推断哪些步骤“在计算上很重要”。我们表明,当基准链以明确的终端答案行结束时,如 GSM8K 和 MATH 中,这些测试主要测量 \emph{答案位置},而不是执行中间计算的位置。使用匹配的 GSM8K 示例,仅删除最终答案语句,同时保留所有推理,会使 Qwen~2.5-3B 的后缀敏感度降低约 $19\times$($N{=}300$,$p{=}0.022$)。冲突答案提示包含正确的推理,但包含错误的明确最终答案,导致五个开放权重模型系列在 7B 时的准确性为零或接近于零;错误答案跟随在 3B--7B 处很强,在更大范围内急剧减弱。 MATH 上的复制、7B 的稳定内比较和无后缀链以不同的形式显示出相同的模式:损坏敏感性跟踪显式答案文本的位置,而不是推理中的固定计算深度。生成时间探测表明,最终答案很少在生成过程中提前确定(${<}5\%$ 早期承诺),但消费时间行为系统地遵循明确的答案文本。因此,混淆主要是当链被消耗时的读出效果。我们提出了一个三个先决条件协议(仅问题控制、格式表征和全位置扫描)作为未来基于腐败的 忠实性 研究的最低实用要求。