论文

OmniRefine:面向高效全模态大语言模型的对齐感知协同压缩

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

模型推理推理加速

摘要

全模态大语言模型(Omni-LLM)在音视频理解上能力强劲,但其实际部署仍受限于长视频流与稠密音频序列的高推理成本。尽管已有进展,现有针对Omni-LLM的压缩方法通常依赖固定或原生的压缩单元,这可能破坏跨模态对应关系以及音视频推理所需的互补信息,难以在稳定保持性能的同时提升推理效率。为解决这一问题,我们提出OmniRefine,一个免训练的两阶段框架,用于Omni-LLM中高效的音视频token压缩。首先,对应保持分块精化通过帧-音频相似度与动态规划,把原生分块边界精化为跨模态对齐的压缩单元。其次,模态感知协同压缩在每个精化单元内联合压缩视频与音频token,在保留关键证据的同时减少冗余。大量实验表明,OmniRefine相比强基线实现了更优的效率-性能权衡,并在更低压缩比下保持稳定性能。在WorldSense上,它在44%的token保留率下仍达到46.7%的准确率,几乎追平全token基线。代码与界面将被发布以促进进一步研究。

OmniRefine:面向高效全模态大语言模型的对齐感知协同压缩:论文配图
图 1:(a) OmniRefine 概述。 (b) OmniRefine 的表现优于 WorldSense 的基线,并且以 44% 的保留率几乎与全token基线相匹配。 (c) 令牌保留的可视化,其中灰色区域被修剪,音频时间线标记保留的锚点相关位置。