论文
词元级 多模式响应视觉注意指导 LLM 知识蒸馏
Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation
摘要
虽然 知识蒸馏 (KD) 被广泛用于通过利用较大教师模型的监督来训练轻量级模型,但事实证明,仅仅依靠输出词元分布不足以压缩多模态 大语言模型 (MLLM)。由于输出标记是关注视觉输入的模型的副产品,因此之前的工作已经探索了明确地提取注意力以提供直接的监督信号。虽然前景广阔,但提取注意力信号的精确效用仍未得到充分探索。在这项工作中,我们挑战了对即时视觉注意力的传统依赖,揭示了下游表现与对视觉注意力的反应与老师的相似性密切相关,但与即时条件注意力的相似性可以忽略不计。此外,我们观察到注意力分布在各个标记之间表现出显着的差异,这表明统一的 蒸馏 目标不是最优的。为此,我们引入了 词元级 响应视觉注意指导(TRAG),这是一个 蒸馏 目标,1)将焦点转移到对视觉信号的响应,2)通过基于注意力熵自适应加权 Kullback-Leibler 散度来采用特定于标记的目标,有效引导学生反映老师的精确视觉焦点。多个基准的大量实验结果表明,TRAG 的性能显着优于之前的 蒸馏 基线。