论文

训练用于黑盒阴谋检测的慎重监视器

Training Deliberative Monitors for Black-Box Scheming Detection

智能体系统Agent 动作执行与治理

摘要

随着自主代理执行现实世界任务的能力变得越来越强,区分阴谋行为和良性任务追求可能成为人工智能控制的核心问题。现有的监控器通常依赖于思想链访问或内部激活,或者使用提示的前沿模型,所有这些都可能不可用、不可靠或部署成本高昂。在这项工作中,我们研究仅行动的审议监视器:较小的开放权重模型,经过训练可以从代理轨迹中检测阴谋和破坏,而无需访问受监视代理的推理或模型内部结构。我们的方法受到协商一致的启发,使用诡计规范从前沿教师那里引出结构化的理由,用单独的法官过滤它们,并将最高质量的理由提炼成具有监督 微调 和强化学习的开放权重监视器。我们在五个数据集上进行训练,并评估六个分布外代理失调基准。我们表明,将我们的方法应用于 Qwen3.5-27B 会产生比所有低成本前沿模型作为提示监视器(Gemini 3.1 Flash-Lite、GPT-5.4 Nano 和 Claude Haiku 4.5)和 Gemini 2.5 Pro 更高的性能,同时还实现了更低的边际推理成本(按词元计费的每 1,000 次评测美元成本)。更强的提示前沿监视器(Gemini 3.1 Pro、GPT-5.4、Claude Sonnet 4.6 和 Claude Opus 4.6)实现了更高的性能,但边际推理成本约为 16$--$34\times$。我们训练有素的几个监控器位于我们评估的监控器中的经验成本-性能帕累托前沿,为提示的前沿模型提供了实用的低成本、低 FPR 替代方案。