论文
模态成熟度指数:评估全向模型多模态能力的基准
Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models
摘要
前沿语言模型越来越多地作为可以跨模态感知和响应的全系统进行营销。然而,现有的评估框架几乎完全专注于双模态理解,通常是文本加另一种模态。我们提出了模态成熟度指数(MMI),这是一个基准,旨在评估 大语言模型 跨五种模态(文本、图像、音频、视频和文档)以及输入和输出中最多三种模态组合的多模态功能。 MMI 包含 893 个问题,每个问题都经过精心设计,要求模型展示其对多种输入模式的理解,并生成包含各种输出格式的响应。这些问题被设计为独立的,对准确回答所需的正确方式或方式组合有明确的期望。每个 MMI 提示都带有针对响应中预期的每种输出模式的人工编写的评分标准;模型的 MMI 值表示每个提示的每种模式得分的平均值。由于低分可能反映出无法生成模态(缺乏存在)或无法生成正确的内容,因此我们还引入了补充模态存在分数(MPS),即针对预期输出模态的每个提示 F1。将 MMI 应用于五个前沿多模态模型,我们发现 MPS 范围从仅 15.6 (Claude Opus 4.6) 到 34.9 (GPT-5.4)。鉴于均匀等级返回模式的可用性较低,我们将 MPS 报告为等待模型改进的主要结果。为了评估使用 LLM 判断器和评分标准判断输出正确性的可行性,我们使用自定义生成工具进行了单独的实验。在生成的资产上,我们发现应用该评分标准的 LLM 法官在 70.8% 的判断上与评分盲人注释者(直接对输出进行评分,从不看到标准)一致。