论文

十二篇 LLM 代理基准论文披露了哪些内容:试点审核和开放评分模式

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

模型评测评测方法与指标

摘要

我们阅读了 12 篇著名的 LLM 代理基准论文,并逐个维度地记录了每篇论文关于其评估运行方式的实际内容。动机来自于一种常见的挫败感:两篇论文将在具有相同模型名称的相同基准上报告结果,但结果不一致,而且你无法说出原因 - 支架、采样设置、子集或评估器版本。在许多情况下,已发布的工件不会让您回答。本文是这一尝试的实施报告。我们设计了一个小型审计模式(五个字段:基准身份、利用规范、推理设置、成本报告、故障细分),用我们在试点评分期间遇到的边界案例编写了评分密码本,将其应用于十二个规范论文(八个代理,四个经典静态),并记录了我们所看到的内容。我们对代理运行的披露进行评分,而不是其正确性,并且不声称披露意味着值得信赖的结果。八个代理基准测试论文的平均审计分数为 0.38(满分 1.0),四个经典静态基准测试的平均审计分数为 0.66;最大的差距在于成本(八篇代理基准论文都没有以任何形式披露推理成本)和利用规范(没有一篇完全披露评估环境的内容寻址容器映像)。我们将架构发布为 JSON 架构文件,将代码本发布为 Markdown 文档,将原始评分表发布为 CSV。评分由一名审核员一次性完成;多评估者审核是自然的下一步,我们讨论我们认为它将改变的内容。