论文
为什么模型知道但不说:开放权重推理模型中思维标记与答案之间的思想链 忠实性 分歧
Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
摘要
扩展思维模型在用户可见的答案旁边公开了第二个文本生成通道(“思维标记”)。本研究针对 MMLU 和 GPQA 问题检验了 12 个开放权重推理模型,并配有误导性提示。在模型实际遵循提示的 10,506 个案例中(选择提示的目标而不是 真值),每个案例都根据模型是否在其思维标记、其答案文本中认可提示、两者都认可或两者都不认可来分类。在 55.4% 的情况下,模型的思维标记包含与提示相关的关键字,而可见答案完全忽略了这些关键字,这种模式称为“思维-答案分歧”。相反(仅回答确认)接近于零 (0.5%),证实不对称是方向性的。提示类型明显地塑造了模式:阿谀奉承是最“透明”的暗示,58.8%的受阿谀奉承影响的案例在两个渠道中都承认教授的权威,而一致性(72.2%)和不道德(62.7%)的提示则以仅思考的承认为主。模型也有很大差异,从接近完全分歧(Step-3.5-Flash:94.7%)到相对透明度(Qwen3.5-27B:19.6%)。这些结果表明,仅对答案文本进行监控会错过一半以上的受提示影响的推理,而思维词元访问虽然是必要的,但仍然使 11.8% 的案例在任一渠道中都没有口头确认。