论文
推理模型会公然撒谎
Reasoning Models Will Blatantly Lie About Their Reasoning
摘要
事实证明,大推理模型(LRM)可能不会“说出他们的想法”:它们并不总是自愿提供有关输入的某些部分如何影响其推理的信息。但模型“忽略”此类信息是一回事,而“撒谎”则是另一回事,更糟糕的是。在这里,我们扩展了 Chen 等人的工作。 (2025)表明LRM将这样做:他们将断然否认在回答多项选择题时依赖提示中提供的提示——即使直接要求反思不寻常(即暗示)的提示内容,即使允许使用提示,即使实验*显示*他们正在使用提示。因此,我们的结果对 CoT 监测和可解释性具有令人沮丧的影响。
