论文
Wuying-Browser-Agent:以真实世界为中心的基础长程浏览器Agent
Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents
摘要
浏览器Agent在简短、干净的演示任务上表现出色,但真实部署根本不同:Agent必须在真实网站上维持数十次决策,同时从错误中恢复并驾驭复杂UI。我们认为,弥合这一差距需要在流水线的每一层进行对齐,包括执行、监督、优化和评估,而不能只靠规模。我们提出Wuying-Browser-Agent,一个应对上述每一层的统一框架。结构化浏览器工具层提供稳定的执行原语与面向决策的上下文管理。反思与UI专精课程SFT(RUIC-SFT)显式地在恢复轨迹和复杂UI交互上训练。发散感知在线GRPO(DAO-GRPO)通过基于势函数的奖励塑形与发散感知的步级加权,改进长程信用分配。最后,我们推出BrowserBench——一个包含350个任务、平均37.9步的双语真实网页基准,因为现有大多数基准太短,无法暴露长程失败模式。Wuying-Browser-Agent-27B在WebVoyager上达到80.6%,在Online-Mind2Web上达到66.7%,在BrowserBench上达到65.1%,在浏览器使用基准上确立了新的开源最优水平。同一流水线还能迁移到浏览器使用之外,展现出很强的通用Agentic能力,在Tau2-Bench、Claw-Eval和BFCL-v4上平均得分73.8。
