论文
混沌智能体
Agents of Chaos
摘要
我们报告一项探索性红队研究,对象是部署在真实实验室环境中的自主语言模型智能体,该环境具备持久记忆、电子邮件账户、Discord 访问、文件系统和 shell 执行能力。在为期两周的时间里,二十位 AI 研究人员在良性与对抗条件下与这些智能体交互。我们聚焦于语言模型与自主性、工具使用及多方通信结合后出现的失效,记录了十一个代表性案例。观察到的行为包括:对非所有者的未授权服从、敏感信息泄露、破坏性系统级操作的执行、拒绝服务状况、不受控的资源消耗、身份伪造漏洞、不安全做法在智能体间的传播以及部分系统接管。在若干案例中,智能体报告任务完成,而底层系统状态与报告相矛盾。我们还报告了一些失败的尝试。我们的发现证实,在真实部署场景中存在与安全、隐私和治理相关的漏洞。这些行为提出了有关问责、授权委托与下游损害责任的悬而未决的问题,需要法律学者、政策制定者和各学科研究者的紧急关注。本报告是对这一更广泛讨论的初步实证贡献。
