论文
强帮助弱:多模态LLM中的定向跨模态对准传输
Strong Helps Weak: Directional Cross-Modal Alignment Transfer in Multi-modal LLMs
摘要
多模态大语言模型 (MLLM) 通过将大语言模型 (LLM) 与目标模态(例如视觉、视频或音频)的编码器配对,实现强大的模态理解。然而,提高MLLM针对给定模态的能力通常需要在大型特定模态数据集上进行额外的训练,从而产生大量的数据收集和计算成本。模型合并提供了一种替代方案,但对于数据稀缺、每个样本大小较大或特定于域的模态(\textit{例如,音频和视频))来说,它通常是不可行的,因为在这些情况下,相同模态的模型变体很少可用。在这项工作中,我们描述了一个有趣的不对称现象:将对齐良好、数据丰富的源模态MLLM合并到数据稀缺的目标模态MLLM中,从而在其自己的基准上大大提高了目标。我们的理论和实证分析表明,这种增益源于特定模态和文本token之间的增强对齐,这是由更强的供体模态引起的。具体来说,我们得出了一个互信息下界,该下界在对齐相关量上是单调的,并且与下游MLLM性能密切相关。基于这一原则,我们提出了定向跨模态对齐转移(DCAT),这是一种新颖的框架,可将文本对齐从强的、对齐良好的源(捐赠者)模态转移到弱的目标(接收者)模态,从而提高目标模态性能,而无需进一步的微调。我们进一步表明,对齐增强物镜允许仅根据一个小的校准集计算出封闭形式的权重空间解。 DCAT 优于现有的模型合并方法,为跨模式对齐传输提供了有效的路径。包含代码的项目页面位于 \url{https://seohoiki3215.github.io/DCAT_project_page}
