论文

SURFPRM:从轨迹构建有环境依据的过程偏好

From Trajectories to Grounded Preferences: Process Preference Synthesis via Interaction Element Graphs for Web PRMs

模型训练奖励建模与过程监督

摘要

比较过程奖励模型 (PRM) 通过评估候选操作之间的状态条件偏好,为自主网络Agent提供关键的步骤级指导。然而,通过多策略采样合成的现有偏好训练数据严重缺乏grounding最小对比对(GMCP)——其中竞争的候选者针对具有相同动作类型的真实页面元素。在代表性基线偏好数据(即WebArbiter)中,GMCP仅占24.19%,使PRM在训练过程中偏向于依赖浅层捷径(例如元素幻觉和动作类型不匹配),而不是获取真正的上下文决策语义。为了应对这些挑战,我们提出了 SURFPRM,一种用于比较 Web PRM 的图形引导流程偏好综合框架。 SURFPRM 将网络演示构建为持久的交互元素图,充当基于环境的负面行动提议机制,系统地综合跨空间、时间和时空混淆轴的对比负面行动。这将 GMCP 比例从 24.19% 提升到 74.60%,生成了精心策划的 SURFPRM-DATA 数据集。在六个开源主干网(3B 到 9B 参数)中,在 SURFPRM-DATA 上训练的 PRM 在 WEBPRMBENCH 和领先的专有 LLM 上的平均表现优于基线训练模型。在 WEBARENA-LITE 上的下游奖励引导轨迹搜索中,SURFPRM 为 GPT-4o (+14.21%) 和 GPT-4o-mini (+12.83%) 策略提供阶梯级指导,从而显着提高复杂 Web 任务的成功率。