论文
Emergence WebVoyager:迈向真实场景下(网页)智能体的一致且透明评估
Emergence WebVoyager: Toward Consistent and Transparent Evaluation of (Web) Agents in The Wild
摘要
对在复杂真实环境中运行的 AI 智能体进行可靠评估,需要鲁棒、透明且与智能体预期执行任务在情境上对齐的方法学。本研究指出现有 AI 智能体评估实践中长期存在的缺陷——以我们对 WebVoyager 的审计为例,这些问题在网页智能体评估中尤为突出,包括任务表述的歧义与操作上的可变性,它们妨碍了有意义且可复现的性能比较。为应对这些挑战,我们提出 Emergence WebVoyager,即 WebVoyager 基准的增强版本,它通过针对任务实例化、失败处理、标注与报告的明确准则来标准化评估方法学。Emergence WebVoyager 达到 95.9% 的标注者间一致性,表明任务表述与评估的清晰度和可靠性均有所提升。应用该框架评估 OpenAI Operator,发现其性能在不同领域与任务类型间存在显著波动,总体成功率为 68.6%,大幅低于 OpenAI 此前报告的 87%,这证明了我们的方法在实现更严谨、更具可比性的网页智能体评估方面的价值。
