论文
保留音频无法说出的内容:Omni-LLM 的上下文保留词元修剪
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
摘要
全模态 大语言模型 (Omni-LLM) 由于处理大量多模态输入词元而产生大量计算开销,因此减少词元对于实际部署至关重要。现有的 Omni-LLM 修剪方法通常通过选择对当前查询很重要或与跨模式线索高度一致的标记来降低此成本。然而,此类策略可能会丢弃不符合这些标准的证据,即使是在需要解决不同的问题或理解超出一致的视听线索的上下文时也是如此。为了解决这一限制,我们将 Omni-LLM 词元缩减重新定义为保留广泛的视听上下文,同时消除跨模式冗余。我们提出了 ContextGuard,这是一个基于此原理构建的推理时间词元修剪框架。 ContextGuard 从音频预测粗略的视觉语义,并修剪粗略语义可能从音频中恢复的视频标记,同时保留额外的视频标记以保留音频单独无法指定的局部视觉细节。为了进一步压缩,我们的方法合并了时间上相似的视频标记。该框架不需要下游 LLM 微调,仅使用独立训练的轻量级预测器。在 Qwen2.5-Omni 和 Video-SALMONN2+ 上,在六个视听基准的 3B 和 7B 尺度上,ContextGuard 的性能优于先前的推理时间修剪方法,同时修剪了更多标记。值得注意的是,在 Qwen2.5-Omni 7B 上,ContextGuard 在六个基准测试中的五个上实现了完整的 词元级 性能,同时修剪了 55% 的输入标记。