论文
你的计划方式重要吗? LLM Web 代理规划表示的实证研究
Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
摘要
尽管最近取得了进展,但基于 LLM 的 Web 代理仍然面临探索有限、关键步骤遗漏以及对任务限制敏感的问题。先前的研究表明,许多失败源于规划的弱点,但替代自然语言规划表示的影响仍未被探索。为了解决这个问题,我们引入了 PlanAhead,这是一个静态规划器执行器框架,用于评估计划表示对代理性能的影响。我们首先自动将 WebArena 任务分为 3 个难度级别,无需人工注释即可实现一致的难度分级。然后,我们系统地评估 4 种不同的计划表示形式,将其分类为困难任务:顺序子目标、叙述、伪代码和清单;跨不同系列的多模式 LLM 支持的代理(OpenAI、阿里巴巴和 Google)。为了考虑随机变异性,我们引入了两种新颖的评估指标:成就率(AR)和已解决任务一致性(STC)。我们的结果表明,计划制定和生成计划的底层 LLM 都会显着影响网络代理的稳健性和任务成功。