论文

新兴世界:长视野多智能体系统的对抗性压力测试

Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems

智能体系统Agent任务评测长程任务评测

摘要

随着人工智能代理从有限任务转向持久部署,在交互很久之后,故障可能会通过内存、工具、其他代理和环境状态传播。这创建了一个无法通过单独评估模型响应来表征的安全机制。 Emergence World 是一个持续运行的多代理环境,用于长视野自治系统的对抗性压力测试。我们在相同的起始条件下运行了由十个智能体组成的八个平行世界:七个​​由不同前沿模型驱动的同质世界和一个混合模型世界。在 16 天内,代理们在追求目标、使用/创建工具、维护持久记忆和管理共享机构的同时,产生了超过 850,000 个 LLM 调用和近 500 亿个词元。操作状态积累后,我们通过普通交互界面传递三个受控压力事件:间接提示注入、错误信息和私人代理记忆暴露。没有一个被评估的世界在所有这三个事件中都实现了完全的恢复能力。检测并不能确保遏制:系统可以识别威胁,同时仍然与敌对内容交互,将其写入自己的持久内存中,并在长达 46 小时后对其采取行动。持续的操作还暴露了反复出现的工具错误、目标漂移、语言不透明、尽管存在私人分歧但仍保持一致以及协调拒绝分配的工作。相同的模型-角色配对在混合群体和同质群体中的表现有很大不同。我们的结果表明,模型级对齐不是组合性的:具有单独能力且表面上安全的代理可以形成具有不同质量的故障模式的系统。随着人工智能变得持久且相互关联,安全的前沿因此从调整模型转向设计弹性自主系统。