论文
VFA:通过无视觉适应增强多语言 MLLM
VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation
摘要
多模态 大语言模型 发展迅速,但大多数仍以英语为中心,因为高质量非英语图像文本监督的稀缺性和高成本限制了多语言多模态指令调整的扩展。尽管多语言文本数据非常丰富,但幼稚的文本 微调 可能会破坏视觉语言对齐并导致灾难性遗忘。我们提出了无视觉适应(VFA),这是一个框架,通过在共享的 LLM 主干上组成互补的任务向量,将多语言语言增强与视觉对齐解耦。具体来说,我们对多语言文本数据的基础 LLM 进行微调,以导出多语言任务向量,然后将其与 MLLM 的视觉对齐任务向量合并。在六个多语言多模式基准测试中对五个 MLLM 进行的实验显示出一致的改进,同时保留了一般的多模式和纯文本功能。此外,VFA 使用不到 2% 的文本数据,缩小了与完全多模态训练模型的差距,展示了其数据效率。