论文
KVE-KD:关键视觉证据引导的视觉语言模型知识蒸馏
KVE-KD: Key Visual Evidence-Guided Knowledge Distillation for Vision-Language Models
摘要
知识蒸馏对于在资源受限的设备上部署视觉语言模型至关重要。然而,现有方法通常对视觉 token 施加统一的监督,或者依赖静态 token 选择,这会将任务相关线索与背景噪声混淆并降低跨模态推理能力。为了解决这个限制,我们提出了关键视觉证据引导的知识蒸馏(KVE-KD),这是一个框架,动态地将特征蒸馏集中在由 教师模型 模型识别的任务相关视觉 token 上。具体来说,KVE-KD指定最终的预生成文本token作为统一语义锚点,并通过迭代视觉token贡献去除分析锚点表示的变化来识别目标跨模态融合层。在这一层中,KVE-KD 通过锚条件注意力分布对视觉 token 进行排序,并选择信息最丰富的视觉 token 作为具有归一化熵的关键视觉证据。关键视觉证据随后指导集中视觉特征蒸馏,使 学生模型 与 教师模型 的任务相关视觉表示紧密结合,同时抑制不相关的背景信息。对六个基准的大量实验表明,KVE-KD 优于最先进的跨模式蒸馏方法,在需要复杂推理和细粒度视觉理解的任务上尤其明显。重要的是,这些改进是在不引入任何推理时开销的情况下实现的。源代码可在 https://github.com/zhangjianbin07/KVE-KD. 获取
