论文
Agent评估可靠性:更多任务不会(总是)修复Agent排行榜
Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
摘要
Agent评估越来越多地用于比较 LLM 并为部署决策提供信息,但排名不仅可以反映模型,还可以反映评估条件(例如支架或任务)的影响。这使得可靠性依赖于声明:对已部署系统进行可靠排名的评估可能无法对底层模型进行可靠排名。我们询问当前Agent评估可靠支持哪些结论,以及哪些额外评估可以改进它们。我们为稀疏、不平衡的Agent排行榜开发了贝叶斯方差分解框架,并将其应用于整体Agent排行榜和 Harbor Index 的 22 个基准。该框架将信号、与预期主张相关的性能差异与噪音、仍可能改变排名的不相关变化分开。我们发现:(1)可靠性取决于测量目标。固定模型支架系统的排名可靠(0.935-0.994),而底层模型的可靠性则要低得多(0.148-0.841)。 (2)支架的选择可以改变结论。支架间可靠性衡量支架是否保留模型排名,表明支架效应在评估中存在很大差异。 (3)更多的任务并不能解决所有的不确定性。当不确定性主要由有限的脚手架覆盖范围主导时,即使有无限多个类似构建的任务,也最多可以将基准的模型排名可靠性提高 0.097。 (4) 汇集不同的基准可以以更低的成本提高跨任务排名。对于不同 Agentic 任务的排名,池基准在相同的任务预算下将预计可靠性从 0.44 提高到 0.75,并且可以将预计成本降低高达 83%。评估设计应遵循预期的主张:确定分数或排名的含义,诊断限制其可靠性的因素,并将评估预算花在重要的不确定性来源上。