论文

带动作修正的世界模型增强 Web 智能体

World-Model-Augmented Web Agents with Action Correction

智能体系统Agent 动作执行与治理

摘要

基于大语言模型的 Web 智能体在自动化网页任务上展现出可观能力。然而,当前 Web 智能体因难以预测环境变化而难以推理出合理动作,且可能缺乏对执行风险的全面认知,过早执行有风险的动作,造成损失并导致任务失败。为应对这些挑战,我们提出 WAC,一个整合模型协作、后果模拟和反馈驱动动作精炼的 Web 智能体。为克服单个模型的认知隔离,我们引入多智能体协作过程,让动作模型咨询作为网页环境专家的世界模型获取战略指导;动作模型随后利用对环境状态转移动力学的先验知识,把这些建议落地为可执行动作,增强候选动作生成。为实现风险感知的稳健任务执行,我们引入两阶段推演链:专注环境状态转移的世界模型模拟动作结果,裁判模型继而审查,必要时触发动作纠正反馈。实验表明,WAC 在 VisualWebArena 上取得 1.8%、在 Online-Mind2Web 上取得 1.3% 的绝对提升。

带动作修正的世界模型增强 Web 智能体
图3:ReAct、WebDreamer与我们的方法(WAC)所采用的动作生成与执行前决策过程对比。ReAct直接执行单个被提出的动作,WebDreamer在模拟候选中进行选择,而WAC支持在执行前进行协作式动作生成与反馈驱动的动作细化,从而带来更稳健的动作选择。