论文

先分配、后排序:OmniLLM的解耦Token压缩

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

模型推理推理加速

摘要

在 OmniLLMs 中,令牌压缩通常被视为一个单一的突出度排名问题:为每个多模态令牌评分,保留前 K 个。我们认为这种抽象是不正确的。相同的注意力分数同时决定两个事情:每个模态保留的容量有多大,以及模态内保留哪些令牌。因此,共享的前 K 规则继承了对音频偏好的分配优先级,保留的容量用于音频令牌,而视频令牌在竞争之前没有机会。我们提出 Macer,这是一种无需训练的压缩器,首先分配明确的音频和视频预算,然后在每个模态的特定浅层进行分配化后的排名。Macer 在保留准确度的同时显著降低了令牌成本,特别是在基于音频的基准上,保留 25% 的令牌,Macer 保留了 Qwen2.5-Omni-7B 的 98.7% 的全令牌性能,而在 Qwen2.5-Omni-3B 上,保留 25% 的令牌,Macer 保留了 97.3% 的全令牌性能。在 Qwen2.5-Omni-7B 上,这个 25% 的设置在 45% 的保留率下达到 OmniZip 等级的性能,同时使用较低的 FLOPs。在 OmniVinci-9B 上,相同的分配-排名原则比共享的前 K 排名方法提高了 12.9 个百分点。

先分配、后排序:OmniLLM的解耦Token压缩:论文配图
图 1:共享注意力有利于跨深度的音频。 cac_{a} 和 cvc_{v} 表示平均音频和视频键。 (a) 查询 qq 更接近 cac_{a},而不是 cvc_{v},因此共享注意力有利于音频。 (b) 在视频基本 (VE) 和音频基本 (AE) 查询下,log⁡(massa/massv)\log(\mathrm{mass}_{a}/\mathrm{mass}_{v}) 跨层保持正值。 (c) 在 VE 查询下的 L3,池化查询位置满足 cos⁡(q,ca)>cos⁡(q,cv)\cos(q,c_{a})>\cos(q,c_{v})。这种几何结构说明了为什么原始共享注意力不是全模态压缩的中性标记显着性空间。