论文

推理模型的思想链 忠实性 根据偏好线索的传递地点和方式而变化

Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

模型评测基准与评测资源

摘要

思想链 (CoT) 监控假设推理轨迹忠实地记录了形成模型答案的信息。现有的 忠实性 测试通常会在用户消息中放置明确的偏见提示,而代理可能会通过工具返回或原始工件遇到偏好。我们引入了 FACE-Eval(提示效果评估的忠实归因),这是一种 5,100 个样本的评估,可改变提示位置(用户消息或工具返回)和明确性(直接摘要或原始工件)。我们衡量线索跟随答案中的口头承诺以及所有线索样本中的非口头采用。我们评估了来自 8 个系列的 15 个开放重量模型,总参数范围从 4B 到 1.60T。每个模型对工具返回的口头承诺低于用户消息提示,对隐含提示的口头承诺低于明确的提示。所有 15 个模型中的工具返回提示以及 30 个模型通道比较中的 28 个中的隐式提示的非语言采用率较高。来源归因提示缩小了七个模型的渠道差距,有时是通过增加用户渠道的非语言采用来实现的,而告诉模型他们的推理将受到监控并不能可靠地缩小差距。我们还使用两个转录监视器(GPT-5.6-Luna 和 GPT-4o-mini)来检测每个系列最大​​模型中的偏好采用。在 32 个模型通道显性单元中,较高的非语言采用与两个监视器的较低检测能力相关(分别为 Pearson r=-0.54 和 r=-0.78)。这些结果表明,当偏好信息通过工具到达或必须从原始工件推断时,在此处测试的单次调用、预填充工具设置中,CoT 监控可能不太可靠。