论文

超越编码器积累:测量多编码器 VLM 中的编码器角色

Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

模型评测模型行为与机制分析

摘要

随着基础模型向融合更多异构视觉流的方向扩展,了解不同编码器在联合训练下如何交互成为原则性设计的先决条件。然而,大型视觉语言模型(LVLM)目前缺乏这样做的工具,并且参数高效的编码器配置在训练之前仍然很难识别。为了重新检查联合训练下的编码器角色,在 16 个基准的 Cambrian-1 套件上,我们在统一的管道(总共约 20k GPU 小时)下重新训练和评估了 5 个常见视觉编码器的所有 31 个非空子集,并报告了三个发现。首先,从头开始重新训练每个子集揭示了编码器排名与通过在固定检查点上屏蔽编码器获得的排名不同,包括哪个编码器总体排名第一。其次,我们将每个编码器的贡献分解为两个轴:容量(编码器自己达到的分数)和必要性(从完整池中删除时的下降)。两个轴不可互换。将两个最高容量的编码器配对是次优的,而将高容量锚与自适应补码配对则与完整的五编码器模型相匹配。在这对之外添加更多编码器只能产生边际收益。第三,在固定参数数量下,每个编码器预投影器的有效排名解释了残差分数的变化。最强的对将一个等级在联合训练中幸存下来的锚与一个等级在其下扩展的补充相结合,这表明等级较高、折叠较少的投影仪输入对应于编码器-投影仪接口处更有利的优化机制。容量-必要性分解和预投影排序分析,以及通过再训练进行的综合评估,揭示了多编码器 LVLM 设计中的方法论差距,并提供了弥补这一差距的具体原语。