论文
用于评估多模态视觉编码器的强大基准大语言模型
A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models
摘要
评估视觉编码器需要可靠地预测其在多模式大语言模型 (MLLM) 中的下游性能的指标。尽管最近的研究表明跨模态指标可以更好地捕捉此类绩效,但单模态指标仍然是实践中的主导选择。在这项工作中,我们通过大规模实验重新审视视觉编码器的跨模式评估。我们确定了现有方法的实验设计和方法制定中的重要局限性。在解决这些限制并引入简单的改进之后,我们提出了 RAVEL,一种基于跨模态最近邻检索的无需训练方法。尽管它很简单,但 RAVEL 在我们的实验中实现了最先进的性能,大大优于以前的方法。我们的结果表明,在仔细且全面的设置下进行评估时,简单的跨模式指标可以为评估MLLM视觉编码器提供坚实的基础。
