论文

WebArbiter:面向Web智能体的原则引导推理过程奖励模型

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

Web智能体在自动化复杂计算机任务方面潜力巨大,但其交互涉及长时程、带不可逆动作的顺序决策。在这类场景中,基于结果的监督稀疏且延迟,常常奖励错误轨迹,也无法支持推理时扩展。这促使在Web导航中使用过程奖励模型(WebPRM),但现有方法仍有限:标量WebPRM把进度坍缩成粗糙、缺乏依据的信号,而基于清单的WebPRM依赖脆弱的模板匹配,在布局或语义变化下失效,并常把表面上正确的动作误标为成功,提供的洞见或可解释性有限。为解决这些挑战,我们提出WebArbiter,一个推理优先、原则诱导的WebPRM,它把奖励建模表述为文本生成,产出结构化的论证说明,以偏好判定收尾,并识别当前上下文下最有利于任务完成的动作。训练遵循两阶段流水线:推理蒸馏使模型具备连贯的原则引导推理,强化学习通过让判定直接与正确性对齐来校正教师偏差,实现更强泛化。为支持系统评估,我们发布WebPRMBench,一个覆盖四个多样Web环境、含丰富任务和高质量偏好标注的综合基准。在WebPRMBench上,WebArbiter-7B超过最强基线GPT-5 9.1分。在WebArena-Lite上的奖励引导轨迹搜索中,它超过此前最佳WebPRM最多6.4分,凸显其在复杂Web任务中的稳健性与实用价值。

WebArbiter:面向Web智能体的原则引导推理过程奖励模型
图2:WebArbiter 概览。给定指令 ℐ、当前观测 o_p 与历史 (a_{<p}, c_{<p}),模型比较候选动作 (a_p^1, c_p^1) 与 (a_p^2, c_p^2)。在 Stage 1,从更强的教师 LLM 蒸馏出原则引导的推理轨迹。在 Stage 2,WebArbiter 使用可验证奖励 R∈{−1,+1} 进行 RL 训练,产生结构化的理由说明与最终裁决。推理时,模型从 (ℐ, o_p, a_{<p}, c_{<p}, (a_p^1, c_p^1), (a_p^2, c_p^2)) 中归纳原则(例如清晰性、正确性、进展性),将其应用于候选动作,并输出可审计的判断,指出最能推进任务完成的动作。