论文

everywhere all at once 基准一切

Benchmark Everything Everywhere All at Once

智能体系统Agent 架构与控制循环

摘要

基准通过提供标准化和明确的绩效衡量标准,是评估和推进 LLM 和 MLLM 的基础。然而,它们的构造是劳动密集型的并且难以重复使用,引发了人们对可持续性和可扩展性的担忧。此外,现有的基准测试在发布后往往很快达到性能饱和,导致对最先进模型的区分不足。为了应对这些挑战,我们引入了 Benchmark Agent,这是一个专为基准构建而设计的完全自主的代理系统。我们的框架编排了完整的基准构建流程,从用户查询分析和子任务设计到数据注释和质量控制。为了评估 Benchmark Agent,我们使用它来生成 15 个代表性基准,涵盖不同的评估场景,包括文本理解、多模态理解和特定领域推理。广泛的实验,包括人工评估、大语言模型法官评估和一致性检查,证明 Benchmark Agent 可以在最少的人工参与下生成高质量的基准样本。更重要的是,通过持续的评估,我们观察到了一些富有洞察力的发现,包括当前的模型难以完成某些特定领域的推理任务。我们相信快速发展的基准可以为研究界做出重大贡献。预览和代码将在演示页面和代码存储库中公开提供。

 everywhere all at once 基准一切:论文配图
图 1:我们的基准代理作为第一个完全自主的基准构建系统,可以跨不同模式、任务和领域高效地生成高质量基准,以满足用户特定的要求。它将提供快速发展的基准来为社区做出贡献。