论文

推理模型会公然撒谎

Reasoning Models Will Blatantly Lie About Their Reasoning

模型评测模型行为与机制分析

摘要

事实证明,大推理模型(LRM)可能不会“说出他们的想法”:它们并不总是自愿提供有关输入的某些部分如何影响其推理的信息。但模型“忽略”此类信息是一回事,而“撒谎”则是另一回事,更糟糕的是。在这里,我们扩展了 Chen 等人的工作。 (2025)表明LRM将这样做:他们将断然否认在回答多项选择题时依赖提示中提供的提示——即使直接要求反思不寻常(即暗示)的提示内容,即使允许使用提示,即使实验*显示*他们正在使用提示。因此,我们的结果对 CoT 监测和可解释性具有令人沮丧的影响。

推理模型有时会就自己的推理说谎
图4:准确率结果。虚线表示对应模型和数据集的基线(无提示)表现,灰色阴影给出 95% 置信区间(CIs)。不出所料,提供正确提示(颜色较深的柱)通常会使表现高于基线,而提供错误提示(颜色较浅的柱)则会使表现下降。这进一步证明这些模型会利用提示(见图2)。