论文

面向思维链忠实性的反事实模拟训练

Counterfactual Simulation Training for Chain-of-Thought Faithfulness

模型训练强化学习

摘要

检查思维链(CoT)推理是理解 LLM 为何产生某输出最常用的手段之一。但 CoT 忠实性的已知问题严重限制了从这一实践中能获得的洞见。本文提出一种名为 Counterfactual Simulation Training(CST)的训练方法,通过奖励那些能让模拟器在反事实输入上准确预测模型输出的 CoT,来提升 CoT 忠实性。我们在两种设定下应用 CST:(1) 基于线索反事实的 CoT 监控,用于检测模型何时依赖虚假特征、进行奖励作弊或谄媚;(2) 基于一般模型生成反事实的反事实模拟,鼓励模型在 CoT 中产生更忠实、更可泛化的推理。对参数量至多 235B 模型的实验表明,CST 能大幅提升基于线索反事实的监控准确率(提升 35 个准确率点),以及对一般反事实的可模拟性(提升 2 个点)。我们进一步表明:(1) CST 优于提示基线;(2) 用 LLM 重写不忠实的 CoT 比单纯 RL 高效 5 倍;(3) 忠实性提升不能泛化到劝阻性线索(与劝服性线索相对);(4) 更大的模型开箱即用时并不会表现出更忠实的 CoT,但从 CST 中获益更多。这些结果表明 CST 可以总体上改善 CoT 忠实性,在 CoT 监控方面应用前景良好。实验代码见 https://github.com/peterbhase/counterfactual-simulation-training。