论文

AVOC:通过检索启发的词元压缩增强全模态 LLM 中的小时级音频视频理解

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

上下文与知识上下文工程

摘要

多模态 大语言模型 在短格式音视频理解方面取得了显着进展,但长格式音视频理解仍然受到有限的上下文窗口和严重信息冗余的挑战。为了解决这些瓶颈,我们提出了 AVOC,一种用于全模态 大语言模型 中长格式音视频理解的框架。 AVOC 在模态编码器和 LLM 主干之间引入了可学习的词元压缩模块。我们将多模式词元压缩重构为 top-$K$ 检索问题:给定固定的上下文预算,该模块必须检索最能支持回答用户查询的紧凑的词元子集。我们从从大量候选池中选择信息单元的三个经典信息检索标准中汲取灵感:相关性、重要性和多样性。 AVOC 将每个标准实例化为音视频理解的定制机制,并将它们集成到统一的检索式压缩管道中。实验表明,AVOC 在长格式音视频基准测试中实现了最先进的性能,在 OmniVideoBench 和 LVOmniBench 上的平均准确度分别超过第二好的模型 4.9 和 5.5 点。此外,AVOC 在长达一小时的音频视频大海捞针任务中保持了强大的性能。