论文
Avenir-Web:采用Mixture of Grounding Experts、模仿人类经验的多模态网页智能体
Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts
摘要
尽管多模态大语言模型不断进步,自主网页智能体在复杂、动态的网页界面上仍难以可靠地执行长时程任务。现有智能体常常受困于不准确的元素grounding、缺乏站点特定的流程知识,以及长期任务追踪与记忆不稳定的问题,在操作复杂文档对象模型(DOM)结构时尤甚。为解决这些局限,我们提出Avenir-Web,一个在真实部署中于Online-Mind2Web基准上达到新的开源最优水平(state of the art)的网页智能体。Avenir-Web利用Mixture of Grounding Experts、用于纳入流程先验的经验模仿规划(Experience-Imitation Planning),以及结合自适应记忆的任务追踪清单,从而在多种用户界面范式间实现稳健、无缝的交互。我们在Online-Mind2Web——一个严格、以真实用户为中心的网页任务基准——上评估Avenir-Web。结果表明,Avenir-Web显著超越此前的开源智能体,并与顶级专有模型性能相当,从而在真实网站上为可靠的网页智能体确立了新的开源最优水平。
