论文

DiM\textsuperscript{3}:通过方向和幅度感知合并桥接多语言和多模式模型

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

模型优化模型合并

摘要

为了实现更通用和类人的智能,大语言模型 应无缝集成多语言和多模式功能;然而,将现有的多模态模型扩展到多种语言通常需要昂贵的多语言多模态数据构建和重复的端到端再训练。我们研究了 无需训练 替代方案:通过在共享语言模型主干中组成剩余更新,将多语言功能注入现有的多模态模型。关键的挑战是多语言和多模式更新是异构的,反映了共享模型中不同的功能角色。为了解决这个问题,我们提出了方向和幅度感知的多语言多模态合并(DiM3),它有选择地在每个参数维度上组合两个更新,同时保留原始视觉编码器和多模态投影仪。在纯文本和视觉语言设置中进行的多语言基准实验,涵盖基于 LLaVA 和 Qwen 的骨干网中的 57 种语言,表明 DiM3 始终优于现有的合并基线,与原始多模态模型相比,显着提高了多语言性能,并且在很大程度上保留了一般多模态能力的同时,与专用多语言多模态 微调 保持了竞争力。我们进一步表明,DiM3 可以直接应用于已经训练好的多语言多模态模型,并且仍然能产生额外的收益。进一步的可解释性分析表明,DiM3 主要重塑中间层语义表示,加强纯文本和多模态输入下的跨语言对齐,同时保留高层任务敏感结构。我们的存储库位于 https://github.com/wzj1718/DiM3。