论文
网页智能体何时完成了却仍然失败:并行网页探索的可复现触发器与踪迹诊断
When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration
摘要
长程网页智能体常以被最终答案评估掩盖的方式失败:它们可能访问有用页面——产出良构答案——自信终止——却仍遗漏字段、过度纳入无支撑项——或依赖过时证据。我们以Parallel WebBench研究这些失败——含1,679条经验证记录的并行网页探索基准:350个人工策展并行任务与1,329条带经验证URL轨迹的重构记录。我们以GRPO在纯人工、均衡人机混合与合成偏重数据配比下训练WebExplorer式智能体。在16k上下文与16轮交互下——最佳GRPO模型把完成率从WebExplorer-8B的50.7%提升到96.0%——GPT-4.1-mini逐项判定的元素F1从0.2489提升到0.4529——但二元准确率仍远低于完成率。踪迹级分析识别三种持续失败模式:上下文束缚的搜索循环、部分答案上的过早终止——以及相关证据已检索后的综合坍缩。这些结果表明合成数据GRPO减少弃答并改进部分正确性——但留下需要证据锚定覆盖与综合诊断的完成-正确性缺口。
