论文
Omni2LoRA:面向高效全模态语言模型的保连贯参数化记忆
Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models
摘要
全模态语言模型(OLM)实现统一的视听理解,但处理长的联合 token 序列使推理在计算上难以承受。尽管近期的 token 压缩方法试图缓解这一负担,孤立地压缩各模态往往会破坏连贯推理所需的时序跨模态锚点。我们提出 Omni2LoRA,一个通过保连贯的上下文蒸馏实现高效参数化记忆压缩的两阶段框架,完全绕过 token 瓶颈。首先,一个 Perceiver 超网络处理冻结 OLM 的中间表示,在单次前向传播中将多模态上下文编码为一个满秩的低秩适配(LoRA)适配器。为防止由此产生的参数占用随录制时长线性扩展,我们通过组相对策略优化(GRPO)优化一个离散秩分配策略,该策略使用模态消融的反事实奖励显式惩罚视听连贯性的损失,迫使模型将固定的次线性秩预算分配给协同的跨模态锚点而非孤立的视觉特征。在三个全模态骨干上,以 30% 秩预算运行的 Omni2LoRA 在四个视听问答基准上优于直接的全上下文推理和强大的 token 压缩基线(OmniZip、OMAC、O-MARC),相较最强基线平均准确率提升 8-12%,并在压缩比高达 75% 时保持稳定,而 token 剪枝方法在此急剧退化。通过将多模态记忆转换为固定预算、可复用的参数状态,我们的方法将回答时的多模态 token 负载降为零,相较全上下文推理将每查询首 token 时间(TTFT)最多降低 12 倍,并在少数几次查询后摊薄至 0.5 秒以内。
