论文

CoME-VL:扩展互补多编码器视觉语言学习

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

模型训练预训练

摘要

最近的视觉语言模型 (VLM) 通常依赖于使用对比图像文本目标进行训练的单一视觉编码器,例如 CLIP 式预训练。虽然对比编码器对于跨模式对齐和检索有效,但自监督视觉编码器通常捕获更丰富的密集语义,并在识别和理解任务上表现出更强的鲁棒性。在这项工作中,我们研究了如何扩展这些互补视觉表示的融合以进行视觉语言建模。我们提出了 CoME-VL:互补多编码器视觉语言,这是一种模块化融合框架,它将对比训练的视觉编码器与自监督的 DINO 编码器集成在一起。我们的方法通过(i)熵引导的多层聚合和正交约束投影来减少冗余,以及(ii)RoPE增强的交叉注意力来对齐异构词元网格并生成紧凑的融合视觉词元来执行表示级融合。融合的词元可以注入到仅解码器的 LLM 中,只需对标准 VLM 管道进行最小的更改。跨不同视觉语言基准的大量实验表明,CoME-VL 始终优于单编码器基准。特别是,我们观察到视觉理解任务平均提高了 4.9%,基础任务平均提高了 5.4%。我们的方法在 RefCOCO 上实现了最先进的检测性能,同时大幅提高了基线。最后,我们对层合并、非冗余特征混合和融合能力进行消融研究,以评估互补对比和自监督信号如何影响 VLM 性能。