论文

用于高效视听视听内容描述的视听交换感知词元修剪

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

模型推理推理加速

摘要

视听视听内容描述从视频和音频内容生成自然语言描述。多模态 LLM 已经推进了这项任务,但这两种模态都为 LLM 输入贡献了许多标记,其中预填充自注意力按二次方缩放。现有的标记修剪方法通常通过注意力、显着性或交叉熵损失来保留标记,但硬阈值选择使得很难保留真正有价值的标记,特别是对于决策边界附近的高混乱性标记。为此,我们在这项工作中提出了 AVEX-Prune,一种基于 RL 的视听动态标记修剪方法。在我们的 AVEX-Prune 中,提出了一种视听词元交换策略,通过用来自相同或其他模态的高置信度候选词元替换低置信度保留词元来选择真正有价值的词元,并测量词元交换中视听内容描述生成的差异。 AVEX-Prune 在 VILA 1.5-8B(54.5 vs. 54.6)和 VideoLLaMA 2(57.0 vs. 56.8)上以 40% 的保留率保留了完整的词元质量。