论文
引发行动的指南:多模式网络代理中指南-行动相互强化的离线研究
Guides That Cause Actions: An Offline Study of Guide-Action Mutual Reinforcement in Multimodal Web Agents
摘要
Web 代理通常在实时环境中进行评估,其中环境状态和判断模型在运行之间会发生漂移,因此同一检查点很少会产生相同的分数,这使得对训练现象的受控研究变得不切实际。我们推出了 WebMRE,这是一个由 541 个任务和 5,293 个步骤组成的离线基准测试,源自成功的 WebArena 轨迹,具有经过全面审核的测试标签和确定性协议,可以在没有任何环境的情况下在每次运行时对检查点进行相同的评分。每个步骤都将一个以人为本的引导句子与一个扎根的动作配对,从而首次研究它们在网络代理中的相互强化效应。平均三个种子的效果对于两个解码顺序的模型都适用,并且随着规模的增长而增长:联合解码指南将元素选择相对于仅动作参考提升了 0.9 和 0.2 点(对于 Qwen3.5-4B)和 1.7 和 2.2 点(对于 Qwen3.5-9B)。中介分析表明,指南是一个因果通道而不是评论:强制将黄金指南作为解码前缀将动作准确性从 0.422 提升到 0.684,另一个步骤的指南将其折叠到 0.055,重命名目标的释义仍然恢复一半的增益,因此通道携带指令含义而不仅仅是标签字符串。相同的通道会产生离线奖励,只有可重玩的协议才能计算该奖励,尽管从强大的检查点对其进行优化尚未带来任何收益。我们经过微调的模型在每个离线指标上均优于 GPT-5.5、Claude Opus 4.8 和 Gemini 3.5 Flash(零射击)。