论文
O-MARC:用于高效视频理解的 Omni 内存增强压缩 蒸馏
O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
摘要
全模态 大语言模型 可以实现统一的音频视频理解,但长联合词元序列使得推理成本高昂,并且现有基准测试不能完全隔离嘈杂的用户生成视频中的视听关联。我们引入 UGC-AVQA,这是一个公共 UGC 基准,包含 1,000 个视频和 4,816 个 QA 对,其中音频去除测试确保基准问题需要声学和视觉证据。为了降低推理成本,我们提出了 OMAC,一种 无需训练 插件压缩方法,可以保留显着的视觉记忆和具有时间定位的的音频锚点。为了进一步使紧凑模型对压缩输入具有鲁棒性,我们引入了 O-MARC,这是一种压缩 蒸馏 框架,用于使用内存压缩多模态上下文进行学习。在 Qwen2.5-Omni-3B 上,O-MARC 将四个基准的平均得分提高到 45.8,优于完整词元推理的 44.1 分和 OmniZip 的 41.0 分。 OMAC 还保持推理效率,与完整词元推理相比,延迟减少了 34.6\%(1.53$\times$ 加速),内存减少了 34.7\%。