论文

网页智能体何时完成了却仍然失败:并行网页探索的可复现触发器与踪迹诊断

When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration

智能体系统模型训练强化学习Agent任务评测RLVR

摘要

长程网页智能体常以被最终答案评估掩盖的方式失败:它们可能访问有用页面——产出良构答案——自信终止——却仍遗漏字段、过度纳入无支撑项——或依赖过时证据。我们以Parallel WebBench研究这些失败——含1,679条经验证记录的并行网页探索基准:350个人工策展并行任务与1,329条带经验证URL轨迹的重构记录。我们以GRPO在纯人工、均衡人机混合与合成偏重数据配比下训练WebExplorer式智能体。在16k上下文与16轮交互下——最佳GRPO模型把完成率从WebExplorer-8B的50.7%提升到96.0%——GPT-4.1-mini逐项判定的元素F1从0.2489提升到0.4529——但二元准确率仍远低于完成率。踪迹级分析识别三种持续失败模式:上下文束缚的搜索循环、部分答案上的过早终止——以及相关证据已检索后的综合坍缩。这些结果表明合成数据GRPO减少弃答并改进部分正确性——但留下需要证据锚定覆盖与综合诊断的完成-正确性缺口。

网页智能体何时完成了却仍然失败:并行网页探索的可复现触发器与踪迹诊断:论文配图
图 1:训练样本之间的奖励信号比较。左:精确匹配评分产生稀疏奖励,并且很少出现正峰值。右图:WebExplorer-8B 裁判评分产生更密集、更平滑的奖励信号。 x 轴代表单个训练样本,y 轴代表奖励值。