论文

背景揭示了Agent周围世界的成本

The Backdrop Exposes What the World Around an Agent Costs It

智能体系统Agent任务评测

摘要

Agent对静止世界中的Agent进行基准测试。部署的Agent在其他人也会改变的世界中工作。有人给Agent商发短信要求将钱汇到其他地方,或者订单确认要求Agent商回复门禁密码。我们提出了 BACKDROP,它询问智能体在清洁世界中的能力有多少能够在这样的世界中生存。 BACKDROP 接受一项任务和Agent执行环境,并在其世界中植入四种日常危险,一次一种,一次全部。指令和正确的最终状态保持不变。每一种危险都会提出一个问题。权限:来自其他人的消息是否会覆盖用户?注入:记录中植入的文本是否会重定向Agent?边界:请求是否会将其拉入未给出的应用程序中?故障:写入失败后且未说明是否已落地,Agent是否会在重试前进行检查?在 3,678 个变体和 16 个型号中,一旦所有四种危险都存在,平均通过率就会从 69.5% 下降到 31.3%;最强的模型下降幅度最大(Claude Fable 5.1,从 96.6% 下降到 56.0%)。Agent已经学会了抵制注入的文本,但经常遵循其他人的其他未经授权的请求。由于存在所有四种危险,并且仅计算植入文本到达Agent的运行,Agent在 46.4% 的运行中遵循另一个人的消息,并在 20.3% 的运行中注入文本。所有 16 个型号的差距都是一致的。 BACKDROP 形式化了这些差距,并展示了智能体在任务世界中的得分如何成为现实世界表现的上限。