论文

KNOWS:评测浏览器智能体检索后的知识整理与成品制作

The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge

智能体系统Agent任务评测长程任务评测

摘要

现有的计算机使用代理基准并没有充分评估充当助理的代理。有用的助手可以跨复杂的多步骤工作流程检索信息,将其合成为工件(文档、演示文稿、电子表格),并导航程序界面以生成连贯的最终产品。此类工作流程需要推理和综合、复杂任务的分解以及视觉和空间理解。为了研究此类工作流程上的代理,我们引入了 KNOWS,这是一个开放式、复杂的、基于浏览器的任务的基准,可以共同评估这些功能,每个任务最终都会生成一个工件。为了编写任务,我们开发了一个任务设计规则和一个协议,以确保任务满足要求。每项任务都配有一个评估器,该程序将确定性检查与 LLM 判断相结合,以平衡代理评估固有的丰富性、可靠性和自动化权衡。我们评估和分析前沿计算机使用代理和基于浏览器的工具。他们在部分成功指标上取得了中等分数,但在我们复杂的长期任务中,表现最好的系统也仅在不足3%的任务中完全成功。即使代理完成了超过 50% 的其他评估步骤,视觉步骤的失败也会导致生成的工件无法使用。我们的结果暴露了当前代理作为端到端助手的局限性,并呼吁在工具使用、视觉理解和长期推理方面取得进展。

KNOWS从任务要求、提示构造到可程序核验任务及质量检查的构建流程。
图2(图注摘要):KNOWS从任务要求、提示构造到可程序核验任务及质量检查的构建流程。