论文
OmniSelect:动态模态感知词元压缩,实现高效全模态 大语言模型
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
摘要
Omnimodal 大语言模型 (OmniLLM) 最近因统一音视频理解而受到越来越多的关注。然而,处理长的多模式词元序列会带来大量的计算开销,因此高效的词元压缩至关重要。现有方法通常依赖于固定的、特定于模态的指导,这无法考虑不同查询中模态的不同重要性。为了解决这个限制,我们提出了 $\textbf{OmniSelect}$,一个 无需训练 模态自适应标记修剪框架,可以为多模态输入动态选择适当的压缩策略。具体来说,我们利用轻量级 AudioCLIP 模型来估计跨模式相关性,并将每个输入分类为三种修剪机制:以音频为中心、以视频为中心和统一修剪。基于这些相关性分数,OmniSelect 进一步在每个时间组内执行细粒度的标记修剪,自适应地分配修剪比率以保留跨模态的信息标记。通过显式地建模模态偏好并启用动态策略选择,OmniSelect 有效地避免了一刀切的压缩陷阱。大量的实验表明,我们的方法可以实现高效的多模态标记减少,同时保持强大的性能,而无需任何额外的训练。