论文

AgentHorizon:长程计算机任务的Agentic裁判评测

AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks

智能体系统模型评测Agent任务评测评测方法与指标

摘要

计算机操作Agent可以完成复杂任务,因此自动裁判越来越多地用于判断任务成功,包括训练或无需人工参与的评测。然而,它们在跨多个应用的长期任务中的可靠性仍不清楚。由长串截图和动作组成的轨迹看似已经完成任务,实际上可能违反指令中的约束或产生不希望出现的副作用。识别这些错误需要裁判结合用户指令检查轨迹。为此,我们提出AgentHorizon:一个包含1,373个计算机操作任务,即指令—轨迹对的基准,来源于覆盖三种操作系统的166小时人工记录轨迹。通过记录对应相近指令的轨迹,我们可以交换指令构造负例。这种配对设计检验裁判是否能区分成功轨迹与完成相似但不兼容请求的轨迹。我们发布三个划分:前沿划分AgentHorizon(AH)、简化划分AgentHorizon-Simple(AH-S)和开发划分AgentHorizon-Development(AH-D)。我们通过两种方式进一步评测十一种裁判:直接输入完整轨迹,最多含300张截图及动作;或者将它们作为编码Agent放在五种Agent Harness中运行。最好的Agentic裁判GPT-5.5在AH子集上达到80.9%的平衡准确率。工具使用能改善部分模型,却使开放权重模型表现变差;不同裁判接受有效轨迹和拒绝失败轨迹的能力差异很大。这些发现强调,裁判需要能够在长交互历史中定位并验证任务确实正确完成的证据,而这些证据往往隐藏得很深。