论文
隐式影响场景下的思维链监控可能不可靠
Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings
摘要
链式推理(CoT)监控已成为前沿推理模型的重要安全层。大多数监测性评估关注显式影响设置:在提示中直接激励模型隐藏某些内容,例如通过指示其执行隐蔽的任务。链式推理监控的另一个互补维度是隐式影响设置:提示中没有指令隐藏,但模型的行为仍然受到任务或上下文特征的影响,例如关于候选人的无关细节,这些细节偏斜了招聘评分。我们引入的第一个基准直接比较CoT监控在两种环境下的表现。我们在存在引导的情况下测试模型行为的变化。引导分为两种类型:一种是隐性的,即通过一个日常的插曲;另一种是显式的,即明确指示模型采取行动并隐藏其行动。基准覆盖四种任务格式(二元选择、数值评分、多项选择问答、开放式编码)和七个前沿扩展推理模型。在显式影响下,CoT监控器检测到60-94%的行为变化:即使被指令隐藏,模型也会泄露其CoT中的指令。在隐式影响下,相同的因素仍然影响行为,但在我们的四个设置中,检测率下降了41-46个百分点。实际系统提示(开发人员可能部署以减少偏题)进一步降低了隐式检测,降至最低5%,同时保留了行为影响本身。这些结果表明,在显式影响下的监测性评估可能高估了监控能力,并且通过有善意的部署选择可以进一步降低监控能力。我们的基准和代码可在https://github.com/agatha-duzan/implicit-vs-explicit-influence获取。