论文
高效推理训练不总是损害CoT忠实性与可监控性
Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability
摘要
思维链(CoT)推理让人类得以检视大语言模型如何得出答案并监督模型行为。这种推理以更高的推理成本为代价,促使训练模型用更少token解题的高效方法。但常见担忧是这类训练会使模型跳过重要推理步骤,使CoT不再忠实反映模型决策。实践中是否或何时发生尚不清楚:不同效率方法以不同方式对CoT施加长度压力,且忠实解释模型决策在某些任务上比其他任务更费token。为理解这些动力学,我们以三种以不同方式施加长度压力的方法微调多种模型:固定生成预算、逐例长度目标、组相对长度奖励。评估高效推理如何影响CoT忠实性(CoT在相关输入上反映模型决策的程度)与可监控性(CoT是否揭示输入干预何时改变输出)。发现:二者受影响不同——忠实性在多数设置下降,主要因受训模型一致性变差;可监控性更稳健,即使CoT短得多模型仍继续承认对答案的影响。