论文

OmniMem:面向流式音视频LLM的扰动感知记忆压缩

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

模型推理KV Cache

摘要

音视频大语言模型(LLM)在长视频理解方面潜力巨大,但其长视频推理从根本上受限于视频词元与键值(KV)缓存的线性增长。我们提出OmniMem,一个专为音视频LLM设计的节省内存的流式框架。与一视同仁对待所有词元的现有压缩方法不同,OmniMem引入模态感知的内存分配策略,分别管理视觉与音频上下文,解决两种模态之间严重的词元失衡问题。OmniMem进一步通过扰动感知的记忆选择保留信息量大且不冗余的KV状态,在不牺牲长程理解的前提下实现紧凑记忆。为在现实部署约束下增强压缩效果,我们还探索了预算感知微调,促使模型把有用信息整合进被保留的记忆中。在VideoMME Long、LVBench和LVOmniBench上使用video-SALMONN 2+和Qwen-2.5-Omni的实验表明,在相同内存预算下,OmniMem相对强免训练压缩基线持续取得2-4%的绝对准确率提升,微调后再增加1-2%。

OmniMem:面向流式音视频LLM的扰动感知记忆压缩:论文配图
图 1:OmniMem 机制示意图。视频是逐块处理的。对于每个输入块,多头自注意力(MHSA)使用过去的KV缓存和当前块的输入。 KV 缓存使用当前块中的新对进行更新,然后根据注意力分数和相似性将其修剪为固定大小(第 3.1 节)。音频和视觉位置对应的KV对分别存储在两个缓存中,每个预算由AVBA确定(第3.2节)。