论文

通过 Gromov-Wasserstein 距离重新思考 VLM 中的模型选择

Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 通过集成视觉编码器增强了传统 LLM 的视觉功能。虽然最近的工作探索了视觉编码器和 LLM 的各种组合,但仍然缺乏对视觉编码器适合 VLM 对齐的原则性理解。在本文中,我们通过对来自不同来源的 19 个预训练视觉编码器进行综合实验,系统地研究了这个问题。我们首先证明了常见的做法,例如选择具有最大尺寸或最高零样本精度的编码器,始终无法识别最佳模型。事实上,这些指标与 VLM 性能的相关性只有弱到中等。这一有趣的发现引出了一个基本问题:视觉编码器的哪些因素在 VLM 中很重要?通过综合分析,我们发现跨模态的结构相似性在视觉编码器选择中起着至关重要但之前被忽视的作用,我们使用 Gromov-Wasserstein 距离作为代理来测量。从理论角度来看,我们表明跨模态映射的可学习性可以证明与 Gromov-Wasserstein 距离相关。对 60 多次完整 VLM 训练运行的实证验证表明,我们提出的仅推理指标的性能明显优于替代模型选择策略,并且与最终 VLM 性能表现出更强的相关性,从而能够在完整训练之前高效且有效地预测 VLM 性能。