论文
BenchGuard:谁来守护基准? LLM 代理基准的自动审核
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
摘要
随着基准变得越来越复杂,许多明显的代理失败根本不是代理的失败 - 它们是基准本身的失败:破坏的规范、隐含的假设和严格的评估脚本,这些脚本会惩罚有效的替代方法。我们建议采用前沿 LLM 作为评估基础设施的系统审计员,并通过 BenchGuard 实现这一愿景,BenchGuard 是第一个面向任务、基于执行的代理基准的自动化审计框架。 BenchGuard 通过结构化 LLM 协议交叉验证所有基准工件,可选择合并代理解决方案或执行跟踪作为附加诊断证据。 BenchGuard 部署在两个著名的科学基准上,在 ScienceAgentBench 中识别出 12 个作者确认的问题(包括导致任务无法解决的致命错误),并且与 BIXBench Verified-50 子集上专家识别的问题中的 83.3% 完全匹配,发现了之前人工审查完全遗漏的缺陷。对 50 项复杂生物信息学任务的全面审核成本低于 15 美元,这使得自动化基准审核成为人类审核的实用且有价值的补充。这些发现指向人工智能辅助基准开发,其中前沿模型不仅作为评估对象,而且作为验证评估基础设施本身的积极参与者。