论文

多智能体AI控制:分布式攻击阻碍每个实例的监控

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

模型评测安全与风险评测

摘要

人工智能控制是一系列技术,旨在防止具有恶意目标的人工智能颠覆其操作者的意图。 AI Control 通常研究一个轨迹中的单个代理,但实际部署在共享基础设施上运行许多代理,并且最严重的风险(模型权重泄露、训练运行中毒)可能需要多个代理协同行动。我们启动了多智能体人工智能控制的实证研究,将分布式攻击形式化,其中多个智能体共同瞄准恶意目标。我们开发了 FakeLab:一个合成的 AI 实验室代码库(9 个服务、86 个良性任务、4 个攻击目标)。我们评估单个代理对分布式攻击的监控,改变代理的数量、它们的协调、模型功能和精确的监控配置。我们的主要发现是碎片效应:随着更多的代理协调攻击,每个代理的监控变得不太可能捕获任何攻击者。其次,这不是由良性代码与恶意代码的比率驱动的——我们认为这可能取决于模型的能力。第三,明确的计划者放大了碎片效应,将完成攻击的速度提高了七倍,并略微加剧了执行者糟糕的监控心理理论。最后:一个较弱的“可信”监控器会错过大多数攻击,而一个较强的监控器会将未被发现的成功减少一个数量级以上,但仍然不完美。我们很高兴根据要求与安全研究人员分享我们的控制设置 FakeLab。