论文

基于 LLM 的网页智能体为何失败?分层规划视角

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

智能体系统Agent任务评测

摘要

大语言模型(LLM)网页智能体越来越多地用于网页导航,但在现实的长时程任务上仍远未达到人类水平的可靠性。现有评估主要关注端到端成功率,对失败发生在何处提供的洞察有限。我们提出一个分层规划框架,从三个层次(即高层规划、低层执行与重规划)分析网页智能体,实现对推理、接地与恢复的过程化评估。我们的实验表明,结构化的规划领域定义语言(PDDL)计划比自然语言(NL)计划产生更简洁、更面向目标的策略,但低层执行仍是主要瓶颈。这些结果表明,要达到人类水平的可靠性,改进感知接地与自适应控制,而不仅是高层推理,至关重要。这一分层视角为诊断和推进 LLM 网页智能体提供了有原则的基础。

基于 LLM 的网页智能体为何失败?分层规划视角:论文配图
图 1:我们提出的分层规划评估框架概述。该管道由 3 个阶段组成:1) 高层规划:LLM 提出高层子目标,2) 低层执行:每个高层子目标被转换为一组低层操作,后置条件检查器验证低层操作是否导致子目标成功完成。如果多次迭代后子目标失败,则触发 3) 重新规划。除了自然语言之外,我们还探索用于高层规划的结构化表示(PDDL)。