论文

Plan-MCTS:面向网页导航动作利用的计划探索

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

智能体系统Agent 规划

摘要

大型语言模型(LLM)已使自主智能体能够处理复杂的网页导航任务。尽管近期研究集成树搜索以增强长程推理,将这些算法应用于网页导航仍面临两个关键挑战:有效路径稀疏导致探索低效,以及嘈杂的上下文稀释了准确的状态感知。为解决这一问题,我们提出 Plan-MCTS,一个通过将探索转移到语义计划空间来重新表述网页导航的框架。通过将战略规划与执行动作落实解耦,它把稀疏的动作空间转换为用于高效探索的稠密计划树,并将嘈杂上下文提炼为用于精确状态感知的抽象语义历史。为确保效率与稳健性,Plan-MCTS 引入双门控奖励(Dual-Gating Reward)以严格验证物理可执行性与策略一致性,并引入结构化精炼(Structural Refinement)以同策略上修复失败的子计划。在 WebArena 上的大量实验表明,Plan-MCTS 取得 SOTA 性能,以更高的任务有效性和搜索效率超越当前方法。

Plan-MCTS:面向网页导航动作利用的计划探索
图2:Plan-MCTS 的总体框架。我们采用 MCTS 探索用于策略性推理的高层计划,同时利用一个 Operator 通过原子动作落地(atomic action grounding)来利用这些计划。