论文

用于基础模型综合评估的细粒度基准生成

Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

模型评测基准与评测资源

摘要

基础模型的评估通常依赖于基准的总分,而这些基准缺乏全面的覆盖范围和元数据来进行细粒度的评估。我们引入了一个自动基准生成的框架。我们的框架生成基于参考材料(例如教科书)的评估问题,产生覆盖面广、元数据丰富且对污染具有鲁棒性的基准。该管道采用多代理架构来生成问题,并采用解决方案图驱动策略,显着提高了 真值 解决方案的可靠性。使用该框架,我们生成了机器学习、公司财务和个人财务方面的三个基准。专家评审发现,真值 错误率明显低于以前的基准(例如 MMLU 和 GSM8K)。对 12 个商业和开源模型的评估表明,我们的基准测试在模型之间实现了近乎统一的能力覆盖范围和表面性能差异,这是现有基准测试无法捕获的。我们将很快开源该框架和我们策划的基准。