论文

LDDR:用于视频 MLLM 的基于线性 DPP 的动态分辨率帧采样

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

上下文与知识上下文工程

摘要

多模态 大语言模型 中的视频理解需要在有限的视觉 词元预算 下从长且冗余的视频中选择信息帧。现有的方法通常依赖于统一采样、逐点相关性评分、逐块选择或代理探索,这些方法要么错过全局依赖性,要么引入大量开销。我们提出 LDDR(基于线性 DPP 的动态分辨率),这是一种 无需训练、即插即用且具有预算意识的视频帧采样框架。 LDDR 在任务调节的特征空间中执行查询感知的行列式点处理 (DPP) 帧选择,与标准 DPP 基线相比,实现了 3 倍的运行时加速。它还引入了组 DPP 重要性度量来指导帧保留和动态分辨率分配,为信息丰富的非冗余帧分配更多词元,同时缩小或修剪不太有用的帧。在涵盖短程、中程和长程视频的四个视频基准测试中,LDDR 始终优于次佳基准,在预算有限的情况下实现了 2.5 点的增益,在高预算场景下实现了 1.6 点的增益。这些改进在多个 MLLM 主干中得到一致观察,包括开源和闭源模型。定性分析证实,相关帧被选择并分配了更高的预算,有助于提高视频理解。