论文
CAP:评估跨站点浏览器智能体复杂动作与感知能力的可扩展基准
CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
摘要
大语言模型正越来越多地被部署为通过浏览器与网络交互的自主智能体。尽管近期的进展由评估端到端任务成功的基准驱动,这些评估在很大程度上忽视了真实网页浏览的两个基本难度来源:对丰富用户界面的复杂操作,以及对动态渲染内容的视觉感知,尤其是在跨越多个网站的工作流中。我们提出CAP,一个可扩展的基准,用于评估浏览器智能体在需要非平凡UI交互与视觉理解的跨站点、拟人化网页任务上的表现。具体而言,我们采用分解-重组流水线:先将每个网站抽象为结构化站点卡片,捕捉面向用户的功能、复杂执行操作与感知需求,再将这些组件重组为真实的跨站点工作流。因此每个任务都落实在各网站上的多个具体操作上,支持细粒度诊断。在此框架下,我们在严格质量控制下构建了覆盖108个真实网站、24个领域的420个任务。使用我们可验证的agent-as-a-judge评估框架对最先进浏览器智能体进行实验,成功率很低,并揭示感知密集型交互仍是主要瓶颈,暴露出当前智能体与真实网页浏览需求之间的巨大差距。
