论文

MetaGAI:面向生成式AI模型卡与数据卡生成的大规模高质量基准

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

模型评测基准与评测资源

摘要

生成式AI的快速普及要求严格的文档标准,以实现透明与治理。然而,人工创建模型卡(Model Card)与数据卡(Data Card)无法规模化,而自动化方法又缺乏用于系统评估的大规模、高保真基准。我们提出MetaGAI,一个综合基准,包含通过对学术论文、GitHub仓库与Hugging Face产物进行语义三角化构建的2,541个经验证的文档三元组。与以往单源数据集不同,MetaGAI采用带有专门Retriever、Generator与Editor智能体的多智能体框架,并通过四维人机协同评估加以验证,其中包括对经编辑器精炼的基准真值的人工评估。我们建立了将自动指标与经验证的LLM-as-a-Judge框架相结合的稳健评估协议。大量分析揭示:稀疏混合专家(Mixture-of-Experts)架构实现更优的成本-质量效率,而忠实性与完整性之间存在根本性权衡。MetaGAI为大规模地基准测试、训练与分析自动化模型卡和数据卡生成方法提供了基础测试平台。我们的数据与代码见:https://github.com/haoxuan-unt2024/MetaGAI-Benchmark。

MetaGAI:面向生成式AI模型卡与数据卡生成的大规模高质量基准:论文配图
图 1:MetaGAI 基准构建示例。为 iBOT 模型 Zhou 等人自动生成 GenAI 卡。 (2022) 演示多源三角测量,将论文中的架构概念、GitHub 中的超参数和 Hugging Face 中的许可数据与基于编辑器的合成相结合,以生成高保真地面事实。