论文

CoArena:实时评估计算机使用和多代理系统

CoArena: Evaluating Computer-Use and Multi-Agent Systems in Real Time

智能体系统Agent任务评测

摘要

计算机使用代理的静态基准测试在发布时修复任务集,并根据它对每个系统进行一次评分。这使得它们具有可重复性,并且让它们偏离了应该测量的内容:固定的任务集会老化,泄漏到训练语料库中,并且无法跟踪人们每周实际使用代理的方式。 CoArena 措施直接使用。真实用户提交任务;两个系统,每个系统都是同一工具界面后面的单个模型或多代理管道,在相同的沙盒桌面中同时执行相同的任务;用户在不知道哪个系统产生这两个结果的情况下判断这两个结果;公共排行榜是根据这些判断进行修改的。核心贡献是对如何实现实时评估的正式说明。我们将实时定义为五个可测量的属性,每个属性都有一个方程式和一个示例:连续任务到达、实时并发执行、在线评级更新、抗污染性的新鲜度以及从失败运行到可重用训练环境的有限反馈延迟。评级方法完全遵循:Bradley-Terry 成对模型、加权观测值和关系的可能性、受惩罚的最大似然估计以及单次投票到达时应用的流式更新(对相同可能性的随机梯度步骤,恢复 Elo)。它给出了来自观察到的信息和集群鲁棒三明治的置信区间、来自参数引导的排名带、新系统进入董事会的规则以及估计的收敛速度。投票质量通过评委间一致统计、冗余评判以及对平局和弃权的明确处理来处理。具有 211 票的五系统示例从投票矩阵传送到评级、间隔和等级范围。每个数字均来自规定的输入或标记为说明性的; none 是对已部署系统的衡量。