论文

LLM Agent排行榜究竟比较什么

What Does an LLM-Agent Leaderboard Rank Actually Compare?

模型评测评测方法与指标

摘要

LLM 代理人排行榜引出了一个熟悉的推论:排名高于另一个的代理人是更好的代理人。当系统在任务混合、标签来源、发布细节或成本规则方面存在差异时,公共评估日志可能不支持该结论。我们研究排行榜分数的估计值以及它们何时证明成对优势结论的合理性。我们的估计感知成对程序规定了比较目标和测量源,检查共同支持,并使用规定的不确定性规则和实际裕度评估支持的差异。受控检查评估已知有限样本条件下的决策标签,并说明为什么在判断目标重新加权的敏感性时必须包括不确定性。在 SWE-bench、AgentRewardBench 和 tau2-bench 中,紧密的排名差异通常无法解决;代理标签和实用程序规则也可以更改选择的系统。 DataAgentBench 和 Open Agent 显示了从粗略的公共记录中仍然可以估计的内容。排行榜分数总结了已发布的评估,而细粒度的优越性声明还取决于用于解释差异的估计值和不确定性规则。