论文

所有评估:AI评估报告的统一模式与社区仓库

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

模型评测基准与评测资源

摘要

人工智能评估广泛用于测试和理解进展。然而,不同的评估者带来了不一致的情况,这给分析和比较带来了挑战。首先,结果以不兼容的格式保存,分散在排行榜、论文、博客文章、评估工具日志和自定义存储库中。其次,不同的评估框架产生的结果,对于名义上相同的评估会产生不同的分数,并且记录元数据不一致,阻碍了比较、跨群体评估科学、降低成本和重用。我们推出 Every Eval Ever,这是第一个用于人工智能评估结果的共享模式和社区众包存储库。该架构标准化了如何在统一的单个 JSON 文档中表示评估。它在设计上与源无关,从评估工具和论文中获取结果,并可选择存储每个实例的输出以进行细粒度分析。我们贡献:(i)社区管理的元数据模式以及配套的实例级模式,这是同类中的第一个标准化工作; (ii) 从流行格式、评估工具和排行榜到统一模式的自动转换器; (iii) Hugging Face 上托管的众包社区数据库,目前涵盖 22,235 个模型、2,273 个独特基准和 31 种评估格式。

所有评估:AI评估报告的统一模式与社区仓库:论文配图
图 1:每个 Eval Ever 都有四个组件:(1) 异构评估数据(排行榜、论文、利用日志、自定义脚本); (2) 已知日志格式的转换器(HELM、Inspect AI、lm-eval)和社区格式的元数据解析器(Hugging Face、排行榜); (3) 支持聚合和实例级结果的统一元数据模式; (4) 众包社区数据库,使公众评估结果易于获取和处理。