论文

长视频理解中事件感知视觉分配的高斯混合建模

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

上下文与知识上下文工程

摘要

由于与均匀采样相关的计算成本过高和信息丢失,大型视觉语言模型(LVLM)在长视频理解方面面临着重大挑战。现有的关键帧选择方法通常将视频帧视为原子实体并平均分配视觉预算,从而忽略高级语义结构并引入大量冗余。为了解决这些限制,我们提出了 GMM-EVA(事件感知视觉分配的高斯混合建模),它利用高斯混合模型从离散的逐帧观察中对事件级结构进行建模。然后应用差异化的分配策略来为每个事件保留一个主要高分辨率关键帧以获得高保真细节,同时利用较低分辨率的辅助关键帧来维护时间上下文并优化 词元预算。 GMM-EVA 是一个 无需训练 即插即用框架,可以在各种相关性度量和下游 LVLM 中稳健地推广。对多个长视频基准的大量实验表明,我们的方法明显优于均匀采样。值得注意的是,GMM-EVA 实现了与基线选择方法相当的性能,同时仅利用了视觉 词元预算 的大约一半,凸显了其卓越的效率和有效性。