论文
视觉指令调整通过抽象来调整模式
Visual Instruction Tuning Aligns Modalities through Abstraction
摘要
视觉指令调整有效地调整了预训练的 大语言模型 (LLM) 来处理图像信息和文本。然而,目前尚不清楚视觉特征如何嵌入到 LLM 主干的分层抽象层次结构中。在一组不同的视觉语言架构中,我们表明指令调优主要充当桥梁,将视觉特征直接嵌入到 LLM 的中间语义层中,绕过致力于单峰处理的早期层。通过探索分析和因果干预,我们表明这些中间层是视觉语言处理的语义核心,并且在广泛的多模式基准测试中发挥着关键作用。此外,通过比较语义等效的视觉和文本表示的几何形状,我们发现 微调 扩展并加强了现有的抽象阶段,将视觉特征与预先存在的文本特征对齐。最后,我们通过将 微调 仅限制在中间层来确认这种局部对齐的功能作用:该策略保留了完整 微调 在以视觉为中心的基准上的性能,同时减少了训练时间。我们的结果表明,多模态集成是由 LLM 内部抽象引擎的重新利用驱动的局部现象。