论文
眼不见心不烦:Omni-LLM 的词元压缩
Out of Sight, Still in Mind: Token Compression for Omni-LLMs
摘要
本文的目标是降低全模态 大语言模型 (Omni-LLM) 在推理时的输入词元成本。 Omni-LLM 对音频、视频和文本进行联合推理,但这三种流的成本高度不平衡:视觉标记占输入的绝大多数,并且高度冗余。在本文中,我们提出了 ReMo,一个 无需训练 框架,通过跨模态重新分配视觉标记的信息来压缩视觉标记:仅当其信息出现在其他地方时才保留视觉标记。 ReMo 通过两种方式实现这一目标:(i) 将音频和视频对齐在公共嵌入空间中,并删除已经由音频或其他视觉标记解释的视觉标记; (ii) 它用紧凑的文本代理、每个对象及其位置的简短描述取代了对象级视觉标记,以更少的标记传达相同的内容。在两个模型尺度的 Qwen2.5-Omni 上,ReMo 删除了 54% 的输入标记,而没有损失准确性。事实上,它略微超过了全词元模型,在五个视听基准测试中分别达到了平均准确度的 101.2% 和 101.3%。