论文

OpAgent:面向Web导航的操作智能体

OpAgent: Operator Agent for Web Navigation

模型训练强化学习Agentic RL

摘要

为完成用户指令,自主Web智能体必须应对真实网站固有的复杂性与易变性。传统范式主要依赖监督微调(SFT)或使用静态数据集的离线强化学习(RL)。然而,这些方法受严重的分布偏移困扰,因为离线轨迹无法捕捉无约束开放Web环境的随机状态转移与实时反馈。本文提出一个稳健的在线强化学习WebAgent,旨在通过与无约束开放网站的直接、迭代交互来优化其策略。我们的方法包含三项核心创新:1)分层多任务微调:我们整理了按功能原语——规划(Planning)、执行(Acting)与定位(Grounding)——分类的全面数据集组合,建立起一个对Web GUI任务具有强指令遵循能力的视觉语言模型(VLM)。2)真实环境中的在线Agentic RL:我们开发了在线交互环境,并使用专门的RL流水线微调该VLM。我们引入一种混合奖励机制,将不依赖真值、用于整体结果评估的WebJudge与用于进度奖励的基于规则的决策树(RDT)相结合。该系统有效缓解了长程导航中的贡献归因难题。值得注意的是,经RL增强的模型在WebArena上取得38.1%的成功率(pass@5),超过所有现有单体基线。3)操作智能体:我们提出模块化agentic框架OpAgent,协调规划器(Planner)、定位器(Grounder)、反思器(Reflector)与总结器(Summarizer)。这种协同实现了稳健的错误恢复与自我纠错,将智能体性能提升至71.6%的新最优(SOTA)成功率。

OpAgent:面向Web导航的操作智能体
图2:OpAgent 的总体架构与训练流水线。(上)系统支持一个多轮交互循环,Operator Agent 在真实网站上执行动作并接收观察,以完成用户查询。(左下)该智能体的开发遵循分层后训练范式:先在离线数据上进行 MT-SFT 以建立基础能力,随后进行 RL in the Wild,在真实环境中进行自适应策略优化。该智能体框架协调包括 Planner、Grounder、Reflector 和 Summarizer 在内的模块化角色。(右下)一条示例轨迹展示了一个复杂退款请求任务的分步执行过程。