论文

OmniFocus:全模态的查询引导模态平衡词元压缩 大语言模型

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

上下文与知识上下文工程

摘要

Omni modal 大语言模型 (OmniLLM) 因其联合处理音频和视频的能力而受到广泛关注,但它们在视听输入下生成大量词元序列,导致大量的推理成本。现有的视听词元压缩方法通常依赖于单模态指导,忽略视听输入中查询相关证据的时间局部性,并隐含地假设两种模态共享时间对齐的信息密度分布。我们提出 \textbf{OmniFocus},一种用于 OmniLLM 的 无需训练 查询引导词元压缩方法,它对视频和音频执行独立的重要性估计,从而实现模态对称压缩设计,在保持视听对齐的同时保留模态特定的显着证据,从而减轻单模态引导压缩可能出现的模态偏差问题。在 Qwen2.5-Omni 模型系列上跨四个视听基准的实验表明,OmniFocus 在低词元保留率下保持了强大的压缩性能,并且在几个主要基准分数上以 25% 的词元保留率优于现有基准。在带有 Qwen2.5-Omni-7B 的 DailyOmni 上,词元保留率为 25%,OmniFocus 保持了 59.40 的准确度,同时相对于全词元基准提供高达 1.38$\times$ 的预填充加速,突出了有利的实际准确度与效率权衡。