论文
MetaGAI:面向生成式AI模型卡与数据卡生成的大规模高质量基准
MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation
摘要
生成式AI的快速普及要求严格的文档标准,以实现透明与治理。然而,人工创建模型卡(Model Card)与数据卡(Data Card)无法规模化,而自动化方法又缺乏用于系统评估的大规模、高保真基准。我们提出MetaGAI,一个综合基准,包含通过对学术论文、GitHub仓库与Hugging Face产物进行语义三角化构建的2,541个经验证的文档三元组。与以往单源数据集不同,MetaGAI采用带有专门Retriever、Generator与Editor智能体的多智能体框架,并通过四维人机协同评估加以验证,其中包括对经编辑器精炼的基准真值的人工评估。我们建立了将自动指标与经验证的LLM-as-a-Judge框架相结合的稳健评估协议。大量分析揭示:稀疏混合专家(Mixture-of-Experts)架构实现更优的成本-质量效率,而忠实性与完整性之间存在根本性权衡。MetaGAI为大规模地基准测试、训练与分析自动化模型卡和数据卡生成方法提供了基础测试平台。我们的数据与代码见:https://github.com/haoxuan-unt2024/MetaGAI-Benchmark。
