论文

在 WebArena-Lite 上审核 Web Agent评估:对结果和轨迹进行人工审查

Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories

智能体系统Agent任务评测

摘要

Web Agent是大语言模型的重要应用,但它们的评估通常取决于基于规则的评估器或仅检查最终结果的语言模型评估器。对任务完成情况的人工验证和对失败轨迹的详细分析仍然有限。我们在基于 GPT 5.5 和未经训练的 Qwen3.5 9B 模型构建的六种评估条件下审核了所有 165 个 WebArena Lite 任务。审核保留原始分数,纠正自动评估器的漏报,识别第一个间接错误,并检查整个轨迹的进展。我们还研究了记忆和分析支持机制(MASM),它维护明确的执行状态,以及指南文本,它提供任务相关的程序指导。在四种 GPT 5.5 设置中,人工审核将评估者错过的成功率恢复了 5.45 至 8.49 个百分点。通过 25 个步骤的预算,Guide Text 将 MASM 的校正成功率从 34.55% 提高到 38.18%。在未经训练的 Qwen3.5 9B 模型上,MASM 将评估者分数从 13.90% 提高到 18.80%。对 102 个失败的 GPT 5.5 轨迹的审查揭示了频繁的滚动循环、未完成的探索、过早的答案、无效的操作和不完整的表单工作流程。阶段级证据进一步表明,早期的实质性进展可能与最终的失败并存。这些结果说明了为什么仅最终分数无法完整地说明网络Agent的行为,并激发了基于人类的轨迹感知验证。