论文
WebArbiter:面向Web智能体的原则引导推理过程奖励模型
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
摘要
Web智能体在自动化复杂计算机任务方面潜力巨大,但其交互涉及长时程、带不可逆动作的顺序决策。在这类场景中,基于结果的监督稀疏且延迟,常常奖励错误轨迹,也无法支持推理时扩展。这促使在Web导航中使用过程奖励模型(WebPRM),但现有方法仍有限:标量WebPRM把进度坍缩成粗糙、缺乏依据的信号,而基于清单的WebPRM依赖脆弱的模板匹配,在布局或语义变化下失效,并常把表面上正确的动作误标为成功,提供的洞见或可解释性有限。为解决这些挑战,我们提出WebArbiter,一个推理优先、原则诱导的WebPRM,它把奖励建模表述为文本生成,产出结构化的论证说明,以偏好判定收尾,并识别当前上下文下最有利于任务完成的动作。训练遵循两阶段流水线:推理蒸馏使模型具备连贯的原则引导推理,强化学习通过让判定直接与正确性对齐来校正教师偏差,实现更强泛化。为支持系统评估,我们发布WebPRMBench,一个覆盖四个多样Web环境、含丰富任务和高质量偏好标注的综合基准。在WebPRMBench上,WebArbiter-7B超过最强基线GPT-5 9.1分。在WebArena-Lite上的奖励引导轨迹搜索中,它超过此前最佳WebPRM最多6.4分,凸显其在复杂Web任务中的稳健性与实用价值。
