论文

AgentWebBench:Agentic Web 中的多代理协调基准测试

AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web

智能体系统Agent任务评测

摘要

代理网络是一种新兴范例,其中自治代理帮助用户使用在线信息。随着范例的发展,内容提供商也在部署代理来管理他们的数据并通过受控接口提供服务。这种转变将信息访问从集中检索转变为分散协调。为了研究此设置,我们引入了 AgentWebBench,这是一个基准测试,用于评估用户代理通过与特定于网站的内容代理交互来合成答案的效果。我们评估了涵盖常见网络信息需求的四项任务,涵盖排名检索(网络搜索、网络推荐)和开放式综合(问答、深度研究)。在七个高级 LLM 和三种协调策略中,多智能体协调通常落后于集中式检索,因为用户代理无法直接访问语料库,但差距随着模型规模的扩大而缩小,甚至在问答方面优于集中式检索。该基准还使我们能够研究数字世界新兴范式的属性。我们发现,去中心化访问将流量集中到一小部分网站,测试时间扩展提高了交互可靠性和任务性能,而出色的结果需要在仔细规划的指导下进行充分的交互。最后,我们的失败分析表明,用户代理需要更好的规划和答案综合,而内容代理需要更可靠的检索和证据质量。代码、数据和 API 发布在 https://github.com/cxcscmu/AgentWebBench 上。