论文

OmniScope:Omnimodal 的模态解耦词元压缩 大语言模型

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

模型推理推理加速

摘要

全模态 大语言模型 的现有词元压缩方法通常依赖于一种模态来确定在另一种模态中保留什么。我们表明,这种假设经常被打破:对于相同的查询,音频和视频相关性通常在不同时刻达到峰值。这种跨模态显着性不匹配使得单向引导很容易在剧烈压缩下丢弃关键答案线索。我们提出了 OmniScope,这是一个 无需训练 词元压缩框架,它使用查询作为共享语义锚,同时分别估计音频和视频的相关性。 OmniScope 分配特定于模态的 词元预算,使用锚点增量策略修剪视觉标记,保留全局上下文和时间变化,并在每秒内合并音频标记以减少冗余,同时保持时间连续性。在四个音频视频基准测试和两个 Qwen2.5-Omni 模型尺度中,OmniScope 在所有压缩设置中实现了最佳平均精度。在总体词元保留率为 25% 的情况下,它可提供高达 3.53 倍的预填充加速和超过 15% 的 GPU 内存减少,而平均准确度仅下降 0.35 点。这些结果提出了 OmniLLM 推理的简单设计原则:跨模态共享查询,但不共享显着性估计。该代码可从 https://github.com/MAC-AutoML/OmniScope 获取。