论文
带动作修正的世界模型增强 Web 智能体
World-Model-Augmented Web Agents with Action Correction
摘要
基于大语言模型的 Web 智能体在自动化网页任务上展现出可观能力。然而,当前 Web 智能体因难以预测环境变化而难以推理出合理动作,且可能缺乏对执行风险的全面认知,过早执行有风险的动作,造成损失并导致任务失败。为应对这些挑战,我们提出 WAC,一个整合模型协作、后果模拟和反馈驱动动作精炼的 Web 智能体。为克服单个模型的认知隔离,我们引入多智能体协作过程,让动作模型咨询作为网页环境专家的世界模型获取战略指导;动作模型随后利用对环境状态转移动力学的先验知识,把这些建议落地为可执行动作,增强候选动作生成。为实现风险感知的稳健任务执行,我们引入两阶段推演链:专注环境状态转移的世界模型模拟动作结果,裁判模型继而审查,必要时触发动作纠正反馈。实验表明,WAC 在 VisualWebArena 上取得 1.8%、在 Online-Mind2Web 上取得 1.3% 的绝对提升。
