论文
哪里出了错?基于语义状态跟踪的Web智能体过程级评估
Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
摘要
Web 代理通过长交互序列进行操作,但现有基准仅评估最终成功,丢弃所有流程信息,并且几乎不提供改进指导。在这项工作中,我们对网络代理进行了流程级分析。我们引入了 WebStep,这是一个包含 1,800 个任务实例的基准测试,具有可控的难度和自动语义状态跟踪。每个网站都在 GUI 旁边公开了确定性语义 MDP:代理在界面上运行,而环境在后台记录高级状态和转换,从而无需手动注释即可进行细粒度分析。基于语义轨迹,我们首先表明流程指标揭示了结果评估中看不见的差异:成功率集中在 31-33% 之间的三个代理在探索范围与执行准确性方面存在差异。然后,按技能分解表征了这些差异的性质,暴露了隐藏在同一网站内的相反的每项技能排名:例如,在住房方面,OpenAI CUA 在提交操作方面比 Qwen3.5 好 23.7%,但在过滤方面比 Qwen3.5 低 15.6%,即使在一个领域内也能精确地找到需要改进的具体技能。分叉分析进一步定位了丢失任务的决定性错误,并表明该错误是代理特定的而不是共享的。最后,随着任务变得越来越困难,这些差异就会扩大:简单任务的成功率相似,但随着探索变得更加困难,成功率就会急剧下降。我们的流程级分析为网络代理评估开辟了一条新途径,为每个代理应在何处以及如何改进提供细粒度且可操作的见解。
