论文
Switch-KD:用于视觉语言模型的 Visual-Switch 知识蒸馏
Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
摘要
视觉语言模型(VLM)在视觉语言联合理解方面表现出了卓越的能力,但其规模庞大,给资源受限场景中的部署带来了重大挑战。 知识蒸馏 (KD) 提供了一种在不增加模型大小或数据要求的情况下改进模型功能的可行方法,从而使部署更加高效。然而,将 KD 应用于 VLM 面临着特定模态监督的挑战:尽管 VLM 中的多模态知识融合在语言空间内,但当前的方法单独监督每种模态,没有明确解决多模态对齐问题,导致多模态知识迁移不一致。为了解决这个问题,我们提出了 Switch-KD,这是一种视觉开关 蒸馏 框架,它将视觉语言知识转移统一在共享文本概率空间内。 Switch-KD包含两个关键组件:(1)Visual-Switch 蒸馏,它将学生的视觉输出切换到教师的语言路径中,为隐式视觉知识迁移构建跨模态概率参考; (2)动态双向 logits 差异(DBiLD)损失,自适应地对齐信息概率区域,同时通过双向监督保留教师和学生的分布结构。在 Switch-KD 的指导下,0.5B TinyLLaVA 有效地从 3B 老师那里提取了丰富的多模态知识,在 10 个多模态基准测试中平均提高了 3.6 个点,而无需任何架构修改。