论文
OmniPack:统一词元压缩,实现高效全模式 大语言模型
OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
摘要
全模态 大语言模型 (Omni-LLM) 在视听理解任务上取得了卓越的性能,但处理长且高度冗余的视觉和音频词元序列会产生大量的计算开销,需要积极的词元压缩才能实现高效部署。现有方法通常在低 词元预算 下性能下降:LLM 之前的压缩可能会丢弃结构上重要且全局分布的证据,而内部 LLM 压缩通常无法充分利用查询条件的视听协作。为了解决这些限制,我们提出了 OmniPack,一个 无需训练 框架,它协调 LLM 之前的结构压缩与 LLM 内任务相关的语义细化。在 LLM 之前,OmniPack 通过特定于模态的重要性、全局覆盖和相似性感知合并来消除结构冗余。经过充分的多模态交互后,它通过文本指导和视听协作进一步巩固多样化的、与任务相关的表示。使用三个 Omni-LLM 主干网对五个基准进行的广泛实验表明,OmniPack 在不同的保留率上始终实现了最佳性能与效率的权衡,优于所有现有方法。值得注意的是,在 Qwen2.5-Omni-7B 上,OmniPack 保留了原始性能的 98.0%,同时将 FLOP 降低至 16.7%,并且仍然保留了原始性能的 92.9%,而 FLOP 仅为原始的 6.8%。