论文

用于评估多模态模型作为集成系统的模型内部协议

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

模型评测评测方法与指标

摘要

随着大型视觉语言模型越来越致力于将视觉生成和理解整合到单个参数空间内,以一致的方式评估这种结构统一仍然是一个关键挑战。当前的评估协议主要将生成能力和判别能力视为单独的任务,从而在统一多模式模型(UMM)的系统级评估中留下了空白。在这项工作中,我们提出了自我生成理解(SGU),这是一种新颖的、无注释的评估框架,它通过语义闭环挑战来探索统一模型的集成能力。在不需要新注释的情况下,SGU 利用 UMM 的双重理解和生成能力,要求它们首先感知图像并生成文本描述,随后根据该描述重建视觉上下文,最后对自身生成的输出进行推理。该管道提供了一个零成本测试台,可生成专为评估 UMM 作为统一系统而定制的综合性能分数。大量的实验表明,即使是高性能的 UMM 也常常难以对自己生成的上下文进行推理,揭示了单独的理解或生成评估无法捕获的局限性。我们的工作提供了一个互补的整体评估框架,并为下一代统一多式联运模型的开发基准测试奠定了基础。