论文

用于可复现全模态基础模型评估的可组合评测系统

A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

模型评测基准与评测资源

摘要

构建全模式基础模型意味着跨文本、图像、视频和音频对其进行评估。每种模态都存在优秀的评估工具包,但它们的推理引擎、提示约定和度量实现相互不兼容,因此从业者最终为每个工具链维护单独的环境,并且仍然难以比较它们之间的结果。 OmniEvaluator 源于我们自己的模型开发中的这种需求:它不是重新实现基准测试,而是在更高级别上连接现有的推理引擎和精选的评估库,通过单个界面公开四个推理后端、四个评估框架和一千多个基准测试。每次运行都被记录为捕获完整配置以进行精确再现的工件,并且结果流入共享仪表板以进行跨模型比较。联合模式在并发评估中共享 GPU 推理服务器,并且内置验证器足够小,可以在 CPU 上运行,可以在各个引擎之间保持分数稳定,并在配置不匹配的情况下基于规则的评分波动时进行提示,匹配具有成本效益的商业 LLM 法官,而无需重复使用 API 成本。该系统、演示视频和仪表板都是公开的。 (https://github.com/naver-ai/omni-evaluator)

用于可复现全模态基础模型评估的可组合评测系统:论文配图
图2 光学仪表板(铅板视图)。仪表板与OmniEvaluator制作的评价工艺品同步,对各种实验的基准结果进行综合观察。左:可作曲过滤器(调制、推论引擎、评价引擎)和跨模型基准比较图表。右:统一头板;缺失的条目明显存在表面模式覆盖缺口(https://gitub.com/naver-ai/omni-evaluator)。