论文
所有评估:AI评估报告的统一模式与社区仓库
Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results
摘要
人工智能评估广泛用于测试和理解进展。然而,不同的评估者带来了不一致的情况,这给分析和比较带来了挑战。首先,结果以不兼容的格式保存,分散在排行榜、论文、博客文章、评估工具日志和自定义存储库中。其次,不同的评估框架产生的结果,对于名义上相同的评估会产生不同的分数,并且记录元数据不一致,阻碍了比较、跨群体评估科学、降低成本和重用。我们推出 Every Eval Ever,这是第一个用于人工智能评估结果的共享模式和社区众包存储库。该架构标准化了如何在统一的单个 JSON 文档中表示评估。它在设计上与源无关,从评估工具和论文中获取结果,并可选择存储每个实例的输出以进行细粒度分析。我们贡献:(i)社区管理的元数据模式以及配套的实例级模式,这是同类中的第一个标准化工作; (ii) 从流行格式、评估工具和排行榜到统一模式的自动转换器; (iii) Hugging Face 上托管的众包社区数据库,目前涵盖 22,235 个模型、2,273 个独特基准和 31 种评估格式。
