论文

与LLAMA回到谷仓:微调视觉语言模型时不断演进的预训练LLM骨干

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)借助强大的预训练大语言模型(LLM)作为核心推理骨干而快速进步。随着推理、指令遵循与泛化能力更强的新LLM不断涌现,如何高效更新现有VLM以纳入这些进步成为迫切需求。然而,将新LLM集成进VLM——尤其是不断演进的LLM如何影响多模态推理、对齐与特定任务性能——仍未被充分探索。鉴于预训练LLM骨干的快速演进,填补这一空白对VLM研发十分重要。本研究对预训练LLM骨干的变化如何影响下游VLM任务性能进行了受控且系统的考察。通过让基于LLAMA-1、LLAMA-2和LLAMA-3的VLM在视觉编码器、训练数据与后训练算法上保持一致,我们发现更新的LLM骨干并不总是带来更好的VLM,性能取决于下游VLM任务。例如,在视觉问答任务中,更新的LLM骨干倾向于解出不同的题目而非单纯解出更多题目,我们的分析表明这是由模型处理信息方式的差异驱动的,包括校准更好的置信度与更稳定的内部表示。我们还发现,某些VLM能力只出现在最新的LLM代际中,而主要依赖视觉理解的任务从更新的LLM骨干中获益甚微。

与LLAMA回到谷仓:微调视觉语言模型时不断演进的预训练LLM骨干:论文配图
(a) ScienceQA 准确度(b) VQA 准确度(c) 地震准确度(d) ScienceQA 实例级性能相关性(e) VQA 测试实例级性能相关性(f) 地震实例级性能相关性图 1:跨不同领域不断发展的预训练 LLM 主干的 VLM 性能。