论文
LIFT:从原语言底座迁移推理向量到视觉语言模型
Can Linguistic Reasoning Vectors Enhance Multimodal Reasoning Ability?
摘要
大多数视觉语言模型 (VLM) 都是通过使用视觉模块和多模态对齐扩展预训练的大型语言模型 (LLM) 来构建的。然而,这种多模态缩放通常会降低最初在基础 LLM 中编码的语言端推理能力。虽然基础 LLM 在扩展后保留了可用的推理,但对齐的 VLM 本身无法可靠地访问此功能。因此,恢复 VLM 中退化的推理能力,向基础 LLM 寻求帮助比单独从 VLM 寻求帮助更有好处。受此启发,我们提出了 LIFT(语言端推理促进和转移),这是一种轻量级矢量干预方法,可将推理能力从基础 LLM 转移到 VLM,而无需重新训练骨干网。 LIFT 将推理向量定义为具有显式推理跟踪的 Reasoner 路径与不具有显式推理跟踪的 Solver 路径之间的答案标记隐藏状态差异,并将这些向量注入到目标 VLM 的语言端激活中。 LIFT 进一步支持可学习的向量适应,同时保持 VLM 主干冻结。我们在六个推理基准上评估两个 VLM 上的 LIFT,比较从基础 LLM 和匹配协议下对齐的 VLM 中提取的推理向量。结果表明,LLM 派生的向量始终优于 VLM 派生的向量,证实基础 LLM 是恢复推理的更有效来源。 LIFT 通过轻量级的语言端干预部分恢复了退化的推理。进一步的分析表明,推理向量影响中间推理行为,而不仅仅是改变最终答案。源代码即将发布。
