论文
基于 LLM 的网页智能体为何失败?分层规划视角
Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
摘要
大语言模型(LLM)网页智能体越来越多地用于网页导航,但在现实的长时程任务上仍远未达到人类水平的可靠性。现有评估主要关注端到端成功率,对失败发生在何处提供的洞察有限。我们提出一个分层规划框架,从三个层次(即高层规划、低层执行与重规划)分析网页智能体,实现对推理、接地与恢复的过程化评估。我们的实验表明,结构化的规划领域定义语言(PDDL)计划比自然语言(NL)计划产生更简洁、更面向目标的策略,但低层执行仍是主要瓶颈。这些结果表明,要达到人类水平的可靠性,改进感知接地与自适应控制,而不仅是高层推理,至关重要。这一分层视角为诊断和推进 LLM 网页智能体提供了有原则的基础。
