论文
面向AI控制的集成监控:多样信号胜过更多算力
Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute
摘要
随着AI系统日益大规模部署于自主智能体场景,确保其采取的动作安全并与用户意图一致至关重要。监控智能体动作是一项关键安全机制,但可靠的监控器仍难以构建,且这些系统的规模使人工监督不切实际。我们表明,将来自多样监控器的信号组合成集成可改善对失配动作的检测。我们使用提示与微调两种策略构建了12个GPT-4.1-Mini监控器。我们在编码任务上评估它们,这些任务中的候选解通过标准测试但在对抗输入上失败。在此设定下,多样性集成优于单个监控器和同质集成。我们最佳的3监控器集成相较三个相同监控器组成的集成取得2.4倍的检测性能增益,且同一集成在独立数据集上表现强劲。我们认为这些结果表明,驱动增益的是多样性而非规模。最佳集成将个体的强劲表现与监控器间的低相关性相结合。此外,微调监控器出现在每一个表现最佳的集成中,并在分布外攻击类型上保持这一优势,表明微调能带来仅靠提示无法激发的检测能力。这些结果支持将集成监控作为一种实用的AI控制策略,以合理的推理成本换取安全收益。
