论文

强帮助弱:多模态LLM中的定向跨模态对准传输

Strong Helps Weak: Directional Cross-Modal Alignment Transfer in Multi-modal LLMs

模型优化模型合并

摘要

多模态大语言模型 (MLLM) 通过将大语言模型 (LLM) 与目标模态(例如视觉、视频或音频)的编码器配对,实现强大的模态理解。然而,提高MLLM针对给定模态的能力通常需要在大型特定模态数据集上进行额外的训练,从而产生大量的数据收集和计算成本。模型合并提供了一种替代方案,但对于数据稀缺、每个样本大小较大或特定于域的模态(\textit{例如,音频和视频))来说,它通常是不可行的,因为在这些情况下,相同模态的模型变体很少可用。在这项工作中,我们描述了一个有趣的不对称现象:将对齐良好、数据丰富的源模态MLLM合并到数据稀缺的目标模态MLLM中,从而在其自己的基准上大大提高了目标。我们的理论和实证分析表明,这种增益源于特定模态和文本token之间的增强对齐,这是由更强的供体模态引起的。具体来说,我们得出了一个互信息下界,该下界在对齐相关量上是单调的,并且与下游MLLM性能密切相关。基于这一原则,我们提出了定向跨模态对齐转移(DCAT),这是一种新颖的框架,可将文本对齐从强的、对齐良好的源(捐赠者)模态转移到弱的目标(接收者)模态,从而提高目标模态性能,而无需进一步的微调。我们进一步表明,对齐增强物镜允许仅根据一个小的校准集计算出封闭形式的权重空间解。 DCAT 优于现有的模型合并方法,为跨模式对齐传输提供了有效的路径。包含代码的项目页面位于 \url{https://seohoiki3215.github.io/DCAT_project_page}

强帮助弱:多模态LLM中的定向跨模态对准传输的原论文方法或结果图
图 2:我们的对齐指标和性能的实证分析。我们分析了整个 $N=114$ 模型检查点的对齐分数和模态性能之间的相关性。我们使用 MMAU Tyagi 等人。 (2025) 对于音频,视频-MME Fu 等人。 (2025) 用于视频,以及 TextVQA Singh 等人。 (2019)视觉表现。 检查点是通过 Ilharco 等人的一系列合并方法获得的。 (2023);亚达夫等人。 (2023);马尔扎克等人。 (2025);加尔吉乌洛等人。 (2025);程等人。 (2025);魏等人。 (2025),结合合并权重的几种变化。红色虚线指的是原始模型的性能。对于所有实验,我们选择了 $k=32$ 和 $\gamma=0.8$,并跨类别测量每个基准 300 个问题的性能。文本嵌入是从问题中提取的。