论文
有关监控的文档训练会导致 CoT 混淆
Training on Documents About Monitoring Leads to CoT Obfuscation
摘要
思想链(CoT)监控是我们用于检测模型不当行为的最有前途的工具之一,但其有效性取决于模型忠实地外化其推理。受此漏洞的启发,我们研究了监控感知模型是否能够混淆其推理以逃避检测。我们使用合成文档微调将八个模型暴露给描述 CoT 监视器的真实 预训练 样式文档,并发现与不知道的控件相比,监视器感知的模型始终能够实现更高的未检测到不当行为的比率。这种效果较弱,但在较困难的代理任务中仍然存在。我们还表明,CoT 可控性(模型在强加的约束下重塑自身推理轨迹的能力)与所研究的八个模型的混淆成功密切相关($r=0.800$,$p=0.017$)。处于同等强化学习优化压力下的监控感知模型也能在不触发 CoT 监控的情况下学习奖励黑客,其速度比不感知的控制要快得多。总之,这些结果表明,监控知识与高 CoT 可控性相结合对基于 CoT 的监控构成了风险。