论文
RCP:用于减轻大型视觉语言模型中的分布偏移的表示一致性修剪器
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
摘要
由于语言解码器处理大量视觉标记,大型视觉语言模型 (LVLM) 的推理成本过高。现有的修剪方法通常会导致性能显着下降,因为视觉标记的不可逆删除会导致隐藏状态的分布变化,从而偏离预先训练的全标记机制。为了解决这个问题,我们提出了表示一致性剪枝(Representation Consistency Pruner),我们称之为 RCP,作为一种新颖的框架,它将累积视觉词元剪枝与延迟修复机制集成在一起。具体来说,我们引入了一种交叉注意力剪枝器,它利用 LLM 的内在注意力作为基线来预测累积掩模,确保跨层一致且单调的词元减少。为了补偿由此产生的信息丢失,我们设计了一个延迟修复适配器,表示为 DRA,它缓存修剪词元的本质,并将基于 FiLM 的调制专门应用于答案生成词元。我们使用修复损失来将修剪表示的一阶和二阶统计数据与全词元教师进行匹配。 RCP 非常高效,因为它仅训练轻量级插件模块,同时允许在推理时丢弃物理词元。 LVLM 基准上的大量实验表明,RCP 删除了高达 88.9% 的视觉标记,并将 FLOP 减少了 85.7%,而平均准确度仅略有下降,并且在几个广泛使用的基准上优于避免 微调 原始模型的先前方法。