论文
VLM 的深度预对准
Deep Pre-Alignment for VLMs
摘要
大多数视觉语言模型 (VLM) 通过轻型投影仪直接将 ViT 编码器的输出映射到 LLM。虽然有效,但最近的分析表明,这种架构面临着对齐挑战:视觉特征与 LLM 初始层中的文本空间仍然相距甚远,迫使模型在肤浅的模态对齐而不是深度理解和复杂推理上浪费关键深度~\cite{zhang-etal-2024-investigating,artzy-schwartz-2024-attend}。在这项工作中,我们提出了深度预对齐(DPA),这是一种新颖的架构,用小型 VLM 作为感知器取代标准 ViT 编码器,确保视觉特征与目标 大语言模型 的文本空间深度对齐。综合实验证明了 DPA 的有效性。在 4B 参数范围内,DPA 在 8 个多模态基准中的表现优于基线 1.9 个点,在 32B 范围内的增益扩大至 3.0 个点。此外,通过将对齐卸载给感知者,DPA 忘记超过 3 个文本基准的语言能力降低了 32.9%。我们进一步证明,这些增益在包括 Qwen3 和 LLaMA 3.2 在内的不同 LLM 系列中是一致的,突出了我们方法的通用性。除了性能之外,DPA 还为当前的 VLM 开发提供无缝升级路径,只需要对视觉编码器进行模块化替换,计算开销很小。