论文

用于评估多模态视觉编码器的强大基准大语言模型

A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

模型评测评测方法与指标

摘要

评估视觉编码器需要可靠地预测其在多模式大语言模型 (MLLM) 中的下游性能的指标。尽管最近的研究表明跨模态指标可以更好地捕捉此类绩效,但单模态指标仍然是实践中的主导选择。在这项工作中,我们通过大规模实验重新审视视觉编码器的跨模式评估。我们确定了现有方法的实验设计和方法制定中的重要局限性。在解决这些限制并引入简单的改进之后,我们提出了 RAVEL,一种基于跨模态最近邻检索的无需训练方法。尽管它很简单,但 RAVEL 在我们的实验中实现了最先进的性能,大大优于以前的方法。我们的结果表明,在仔细且全面的设置下进行评估时,简单的跨模式指标可以为评估MLLM视觉编码器提供坚实的基础。

用于评估多模态视觉编码器的强大基准大语言模型的原论文方法或结果图
图 7:RAVEL 概述。给定配对的图像文本样本,RAVEL 应用稳定的 PCA 白化,分别使用块级和全局相似性构建视觉和文本邻域,并通过已知的图像文本对应来测量它们的一致性。