论文

正确答案,无效痕迹:可验证的小学数学揭示了关于思维链痕迹的内容

Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces

模型评测模型行为与机制分析

摘要

思维链追踪被广泛解读为模型如何得出答案的记录,为调试、Agent审计和推理声明提供信息。测试这种解释很困难,因为自然语言思维痕迹很少可以机械地验证。我们在 iGSM 中重新审视它,这是一个综合小学数学基准,旨在研究思维轨迹,并用于支持学习推理和规划的主张。至关重要的是,iGSM 公开了正确的解决方案应使用的确切数量和依赖性,允许以编程方式逐步检查生成的跟踪,并使我们能够测试正确的答案是否可靠地伴随着有效的跟踪。我们首先评估专门在有效、最小痕迹上训练的模型。答案正确性和跟踪有效性在分布上几乎一致,但与分布脱钩:在最困难的情况下,31.6% 的正确答案具有无效跟踪,其中超过一半通过了所有语法和算术检查,但未通过语义依赖性检查。然后我们介入痕迹监督。非最小训练轨迹会产生非最小输出,而用不同的查询重新询问相同的问题会揭示从原始查询继承的计算,从而削弱了作为选择性规划证据的最小性。尽管没有跟踪传递验证,但即使在分布之外,对 10% 的训练跟踪句子中的标记进行洗牌也能保持近乎干净的准确性。交换的训练轨迹同样保持了较高的分布精度。我们讨论这些发现对人工智能安全背景下的思想链监控和解释的影响。