论文

推理模型能察觉其思维链被改动吗?

Can Reasoning Models Detect Changes to their Chains of Thought?

模型评测模型能力评测

摘要

有多种理由想要编辑模型的思维链(CoT)——例如用更强模型的推理预填充它——或移除可能产出不安全输出的步骤。这些干预的成功很可能取决于模型无法察觉它们——因为若模型怀疑被篡改可能会改变行为。本工作中——我们研究近期推理模型能否在多样条件下察觉对自身CoT的此类干预:推理期间与之后——以及既以自身CoT预填充也以其他模型的CoT预填充。总体上我们发现:(i) 模型仅展现非常有限的检测准确率;(ii) 模型难以识别其CoT是如何被修改的;(iii) 模型检测自身CoT改动与检测他模型CoT改动的能力相当。

推理模型能察觉其思维链被改动吗?:论文配图
图 1:我们用经过各种方式修改的 CoT 预填充模型,并评估它们是否可以在不同条件下检测到这些修改。总体而言,当前的推理模型表现平庸,而且通常并不比机会更好。