论文

面向AI控制的集成监控:多样信号胜过更多算力

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

智能体系统Agent 动作执行与治理

摘要

随着AI系统日益大规模部署于自主智能体场景,确保其采取的动作安全并与用户意图一致至关重要。监控智能体动作是一项关键安全机制,但可靠的监控器仍难以构建,且这些系统的规模使人工监督不切实际。我们表明,将来自多样监控器的信号组合成集成可改善对失配动作的检测。我们使用提示与微调两种策略构建了12个GPT-4.1-Mini监控器。我们在编码任务上评估它们,这些任务中的候选解通过标准测试但在对抗输入上失败。在此设定下,多样性集成优于单个监控器和同质集成。我们最佳的3监控器集成相较三个相同监控器组成的集成取得2.4倍的检测性能增益,且同一集成在独立数据集上表现强劲。我们认为这些结果表明,驱动增益的是多样性而非规模。最佳集成将个体的强劲表现与监控器间的低相关性相结合。此外,微调监控器出现在每一个表现最佳的集成中,并在分布外攻击类型上保持这一优势,表明微调能带来仅靠提示无法激发的检测能力。这些结果支持将集成监控作为一种实用的AI控制策略,以合理的推理成本换取安全收益。

面向AI控制的集成监控:多样信号胜过更多算力:论文配图
图 2:在低误报率 (FPR ≤\leq 10%) 下比较单个监视器和整体性能的 ROC 曲线。与任何单独的监测器相比,该整体在该区域的 ROC 曲线下面积 (pAUC) 最大。该集成在几乎所有 FPR 阈值上都实现了最高的 TPR。