论文
推理模型能察觉其思维链被改动吗?
Can Reasoning Models Detect Changes to their Chains of Thought?
摘要
有多种理由想要编辑模型的思维链(CoT)——例如用更强模型的推理预填充它——或移除可能产出不安全输出的步骤。这些干预的成功很可能取决于模型无法察觉它们——因为若模型怀疑被篡改可能会改变行为。本工作中——我们研究近期推理模型能否在多样条件下察觉对自身CoT的此类干预:推理期间与之后——以及既以自身CoT预填充也以其他模型的CoT预填充。总体上我们发现:(i) 模型仅展现非常有限的检测准确率;(ii) 模型难以识别其CoT是如何被修改的;(iii) 模型检测自身CoT改动与检测他模型CoT改动的能力相当。
