论文

泄密追踪:使用思维链动力学检测 LLM 中的推理失败

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

模型评测模型行为与机制分析

摘要

思想链 (CoT) 推理提高了 大语言模型 (LLM) 性能,同时还为模型的推理过程提供了可观察的接口。然而,利用语言化 CoT 来监控推理正确性的现有方法主要评估各个中间步骤的语义正确性或一致性,而不是推理过程如何在整个跟踪中演变。因此,分布在整个推理轨迹上的失败,而不是局限于单个错误步骤的失败,仍然相对未得到充分探索。此外,语言化的 CoT 不需要忠实地反映模型的内部推理,激励分析不将单个陈述视为内部计算的字面解释。因此,在这项工作中,我们询问是否可以利用可见 CoT 的动态来系统地区分成功和失败的推理,而无需假设此类语义 忠实性。我们研究了一系列关于具有可变复杂性的可验证布尔可满足性任务的 LLM,从而能够在每个模型的能力边界附近进行受控比较。通过推理函数标记 CoT 句子揭示了 SAT 问题的过早验证崩溃:不正确的痕迹更早进入子句检查,重复类似的操作,并更快完成。在 UNSAT 问题上,模型会自以为是地走向不正确的 SAT 结论,检查考生的作业,而不是在构建的案例中得出矛盾。随后,有针对性的证据搜索提示干预将 Llama3-70B 的准确率从 13.3% 提高到 85%,纠正了 84.6% 的错误。这些结果表明,能力故障可以表现为可见推理结构中分布式的、任务相关的变化,并且与语言轨迹是否反映模型内部计算无关的 CoT 动态可以帮助诊断和纠正故障。