论文
用于可复现全模态基础模型评估的可组合评测系统
A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation
摘要
构建全模式基础模型意味着跨文本、图像、视频和音频对其进行评估。每种模态都存在优秀的评估工具包,但它们的推理引擎、提示约定和度量实现相互不兼容,因此从业者最终为每个工具链维护单独的环境,并且仍然难以比较它们之间的结果。 OmniEvaluator 源于我们自己的模型开发中的这种需求:它不是重新实现基准测试,而是在更高级别上连接现有的推理引擎和精选的评估库,通过单个界面公开四个推理后端、四个评估框架和一千多个基准测试。每次运行都被记录为捕获完整配置以进行精确再现的工件,并且结果流入共享仪表板以进行跨模型比较。联合模式在并发评估中共享 GPU 推理服务器,并且内置验证器足够小,可以在 CPU 上运行,可以在各个引擎之间保持分数稳定,并在配置不匹配的情况下基于规则的评分波动时进行提示,匹配具有成本效益的商业 LLM 法官,而无需重复使用 API 成本。该系统、演示视频和仪表板都是公开的。 (https://github.com/naver-ai/omni-evaluator)
