论文
Omni-Prune:查询感知统一词元修剪,实现高效全模式 大语言模型
Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models
摘要
全模态 大语言模型 (OmniLLM) 正在快速扩展多模态推理以涵盖同步音频和视频。然而,生成的音频-视频词元序列很长,导致推理时的预填充延迟和 GPU 内存使用率较高。现有的词元修剪方法主要针对仅视觉输入而设计,错过了音频和视频之间的跨模式链接以及决定哪些内容重要的用户查询。为了弥补这一差距,我们提出了 Omni-Prune,这是一种 无需训练 查询感知视听词元修剪框架,它联合删除两种模式中的冗余,同时保留与任务相关的跨模式证据。具体来说,Omni-Prune 首先将标记序列分割为放置在音频显着性峰值处的自适应时间窗口,然后在将编码器注意力与文本查询相关性相结合的单一尺度上对音频和视频标记进行评分,并将相关的音频-视频标记配对,以便将它们保持在一起。在每个窗口中,最后的 K-medoids 步骤会选择一些代表性标记,添加仅基于分数的选择会错过的各种线索。大量实验表明,Omni-Prune 的性能优于既定的基准方法,可将预填充速度提高 3.25 倍,内存减少 1.3 倍,同时保留超过 99% 的全模型性能。