论文

MCD:大视觉语言模型中多模态上下文学习的因果蒸馏

MCD: Causal Distillation of Multimodal In-Context Learning in Large Vision-Language Models

摘要

大型视觉语言模型 (LVLM) 表现出强大的多模态上下文学习 (ICL) 能力,但这种能力会随着模型大小的减小而大幅下降。知识蒸馏提供了一种弥补这一差距的自然方法,但现有方法主要直接对齐输出分布或隐藏表示。这种对齐方式告诉学生老师的预测是什么,而不会透露复杂背景下的哪些证据因果支持该预测。因此,学生可以模仿老师的答案,同时继续依赖语言先验、提示结构或其他虚假提示。为了解决这一限制,我们引入了多模态因果蒸馏(MCD),这是一种蒸馏框架,可以转移强大的教师在 ICL 期间如何使用多模态证据。 MCD 使用保留结构的词元干预来识别和验证因果证据,然后转移当证据被保留或删除时教师的反应方式。该设计将蒸馏与因果模式联系起来,模型通过该模式在多模态 ICL 期间使用上下文证据。三个 LVLM 系列和七个基准的实验表明,MCD 平均将学生成绩提高 7.23 分,比普通蒸馏法高出 4.68 分,而进一步的分析证实了这些收益的普遍性。