论文
LinguDistill:通过选择性跨模态恢复视觉语言模型中的语言能力 蒸馏
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
摘要
由于多模态适应过程中引入的表征转移和跨模态干扰,将预训练语言模型 (LM) 调整为视觉语言模型 (VLM) 可能会降低其原生语言能力。即使使用标准物镜针对特定任务的 微调,这种损失也很难恢复。先前的恢复方法通常引入额外的模块,充当中间对齐层来维护或隔离特定于模态的子空间,这增加了架构复杂性,在推理时添加参数,并限制了模型和设置之间的灵活性。我们提出了 LinguDistill,这是一种无适配器的 蒸馏 方法,它利用原始冻结的 LM 作为教师来恢复语言能力。我们通过引入分层 KV 缓存共享来克服实现视觉调节教师监督的关键挑战,这使教师可以接触到学生的多模态表示,而无需修改任一模型的架构。然后,我们有选择地提取教师在语言密集型数据上的强烈语言信号,以恢复语言能力,同时保留学生对多模态任务的视觉基础。结果,LinguDistill 恢复了语言和知识基准测试中 10% 的性能损失,同时在视觉密集型任务上保持了相当的性能。我们的研究结果表明,无需额外模块即可恢复语言能力,为多模态模型中模态特定的退化提供了有效且实用的解决方案。