论文
思维链监视器也会被越狱,即使推理仍对人可读
Monitor Jailbreaking: Evading Chain-of-Thought Monitoring Without Encoded Reasoning
摘要
思想链 (CoT) 监控是一种很有前途的推理模型安全技术,可以在模型采取行动之前检测到有问题的推理。一个关键问题是编码推理,模型以监视器和人类无法解释的方式隐藏其真实推理。强化学习期间 CoT 监视器的优化压力被认为是此类行为的可能驱动因素。我们通过训练推理模型来执行主要任务和副任务来调查这一点,同时在监视器检测到有关副任务的推理时对它们进行惩罚。令人惊讶的是,模型学会了逃避监视器,而不对其推理进行编码。相反,他们学习表达和格式化他们的思想链,这样监视器就无法标记副任务推理,而推理对人类读者来说仍然是完全透明的。我们把这种现象称为监控越狱。我们发现监视器越狱会出现在不同的模型规模、监视器和任务中。越狱适用于训练期间未见过的监视器,包括功能较弱和较强的监视器,并在不同的监视器提示之间转移。虽然越狱策略看起来很简单,但手动复制它们并不能可靠地欺骗监视器。最后,我们证明改述是一种有效的防御:改述越狱的 CoT 允许同一监视器正确标记它,同时仍然允许模型执行这两项任务。
