论文
AI 代理和 大语言模型 的自动基准审核
Automated Benchmark Auditing for AI Agents and Large Language Models
摘要
现代人工智能基准的运行复杂性超过了传统验证方法。由领域专家编写的任务通常包含隐含的假设、不完整的环境规范以及人工注释无法可靠捕捉的脆弱评估逻辑。我们引入了自动基准审核 (ABA),这是一个代理框架,可以系统地审核各个基准任务,发现隐藏的环境依赖性、规范差距和有限的评分逻辑等问题。我们在一系列前沿 LLM 基准测试和之前的 NeurIPS 出版物上运行 ABA,总共涉及 9 个领域的 168 个基准测试。在这个语料库中,ABA 在超过 25.7% 的评估任务中发现了关键问题,包括任务设计不明确、执行环境冲突以及不正确的基本事实。这些自动审核的准确性通过专家评审和独立第三方报告(例如上游 PR)进行验证。至关重要的是,我们证明这些有问题的任务严重扭曲了代理和 LLM 的能力评估:过滤掉这些有问题的任务会改变模型排名,并将 SWE-bench Verified 和 Terminal-Bench 2 的平均性能分别提高 9.9% 和 9.6%。我们发布了代理工具和所有任务注释,以支持前沿基准的未来发展。