论文
Odysseys:在现实的长期任务上对 Web 代理进行基准测试
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
摘要
现有的网络代理基准测试主要集中在短期的单站点任务上,而前沿模型正在接近饱和。然而,现实世界的网络使用由长期、多站点的工作流程组成。常见的网络导航任务,例如比较不同领域的产品、规划跨多个服务的行程或总结多个搜索查询的信息,需要在可能的浏览时间中持续进行上下文和跨站点推理。为了捕获和评估此类行为,我们引入了 Odysseys:一个由 200 个长期 Web 任务组成的基准,这些任务源自在实时互联网上评估的现实世界浏览会话。我们发现二元通过/失败评估对于长期设置来说是不够的,并引入了基于评分标准的评估,用平均 6.1 评分评分标准来注释每个 Odysseys 任务。我们证明,与常用的轨迹级 LLM-as-a-judge 评估指标相比,这与人类产生了更高的一致性,并提供了更细粒度的信号。我们测试了几个领先的前沿模型,发现最强的模型达到了 44.5% 的成功率,这为未来的改进留下了很大的空间。除了任务成功之外,我们认为效率是长视野智能体的首要关注点。我们引入了轨迹效率指标(每步的评分标准),发现即使是前沿智能体也只能达到 1.15%,这表明智能体显然需要能够有效地取得成功,而不仅仅是最终成功。 Odysseys 隔离了对开放网络环境中长期熟练程度的关键评估,提供了一个现实的基准来衡量计算机使用代理的进展,这些代理可以有效地运行数小时。我们在 https://odysseys-website.pages.dev 发布我们的任务、评估脚本和其他结果