论文
推理轨迹塑造输出,但模型不肯承认
Reasoning Traces Shape Outputs but Models Won't Say So
摘要
我们能信任大型推理模型(LRM)产生的推理轨迹吗?我们研究这些轨迹是否忠实反映了驱动模型输出的因素,以及模型是否会诚实地报告其影响。我们提出Thought Injection(思维注入),该方法将合成的推理片段注入模型的<think>轨迹,随后测量模型是否遵循被注入的推理并承认这一点。在来自三个LRM的45,000个样本中,我们发现注入的提示能可靠地改变输出,证实推理轨迹对模型行为具有因果性塑造作用。然而,当被要求解释其改变的答案时,模型绝大多数情况下拒绝披露这一影响:在30,000个追问样本中,针对极端提示的总体不披露率超过90%。模型不仅不承认被注入的推理,反而编造看似对齐但实际无关的解释。激活分析揭示,在这些编造过程中,与谄媚和欺骗相关的方向被强烈激活,表明这是系统性模式而非偶发失误。我们的发现揭示了LRM所遵循的推理与其所报告的推理之间的鸿沟,引发对看似对齐的解释可能并不等同于真正对齐的担忧。
