论文

面向基于LLM的Web智能体的AI规划框架

AI Planning Framework for LLM-Based Web Agents

智能体系统Agent任务评测

摘要

为Web任务开发自主智能体是人工智能的核心挑战。尽管大语言模型(LLM)智能体能够解读复杂的用户请求,但它们常常以黑箱方式运行,难以诊断其失败原因或规划方式。本文通过将Web任务形式化为序贯决策过程来填补这一空白。我们提出一个分类法,将现代智能体架构映射到传统规划范式:逐步执行(Step-by-Step)智能体对应广度优先搜索(BFS),树搜索智能体对应最佳优先树搜索,预先完整规划(Full-Plan-in-Advance)智能体对应深度优先搜索(DFS)。这一框架可以对上下文漂移与任务分解不连贯等系统失效进行有原则的诊断。为评估这些行为,我们提出五个新颖的评估指标,在简单成功率之外衡量轨迹质量。我们以一个新数据集支撑这一分析,其中包含来自WebArena基准的794条人工标注轨迹。最后,我们通过将基线Step-by-Step智能体与新实现的Full-Plan-in-Advance智能体对比,验证了评估框架。结果显示,尽管Step-by-Step智能体与人工金标准轨迹更接近(总体成功率38%),Full-Plan-in-Advance智能体却在元素准确率(89%)等技术指标上更胜一筹,这证明了在依据具体应用约束选择合适智能体架构时,所提指标的必要性。

面向基于LLM的Web智能体的AI规划框架:论文配图
图 1. 任务 40 中的示例步骤说明了代理的决策过程。粉色部分(标记为 A)表示前一个操作,顶部灰色部分(标记为 B)详细介绍了智能体的推理过程,底部灰色部分(标记为 C)包含元数据(我们在分析中未包含这些数据),黄色部分(标记为 D)表示下一个要执行的操作。