论文
忠实性 作为信息流:评估和训练忠实的思维链推理
Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning
摘要
仅当推理轨迹忠实反映产生最终答案的计算时,思想链 (CoT) 推理才可用于监控语言模型。然而,模型可能依赖于绕过 CoT 的提示回答捷径,使得可见的推理轨迹即使看起来合理,也会产生误导。我们从结构信息流的角度研究 CoT 忠实性:忠实推理应该通过从提示到 CoT 的中介路径来路由与答案相关的信息,而不是通过直接提示到答案的捷径。这种观点产生了一个基于三个互补属性(充分性、完整性和必要性)的任务无关框架,我们用基于熵、masked-KL 和基于梯度的诊断来实例化该框架。我们表明,这些指标恢复了外部判断的 忠实性 在暗示推理中的差异,并确定了基于 KL 的诊断的低熵故障模式,其中基于梯度的测量保持更稳定。在此分析的基础上,我们引入了基于验证者的 同策略 RL 的更新时间干预,包括注意力掩蔽、仅向后梯度掩蔽、CoT 梯度和提示表示的对抗性扰动。通过暗示算术、可奖励破解的代码修复以及在没有提示的情况下训练但在错误提示注入下进行评估的 DAPO-Math 模型,我们的干预措施将行为和结构指标转向更强的 CoT 中介。特别是,它们使快捷方式和 奖励作弊 行为在 CoT 中更加透明,并改进与任务无关的 忠实性 指标,同时在某些设置中还降低了错误提示的敏感性。我们的结果表明,在训练期间控制信息流是实现更忠实和可监控的 CoT 推理的实用途径。代码可在 https://github.com/safety-research/faithful-cot 获取。