论文
ReUnit:用于长视频理解的多粒度视觉单元化
ReUnit: Multi-Granularity Visual Unitization for Long Video Understanding
摘要
长视频理解受到视频多模态 大语言模型(Video-MLLM)有限的视觉输入能力的限制。现有方法主要优化保留哪些内容,而保留内容的呈现方式往往保持固定。因此,在整个视觉输入中,空间细节和内容覆盖之间实现了相同的平衡。我们提出 ReUnit,一个 无需训练 和查询感知框架,共同确定要保留哪些内容以及如何呈现内容。在帧级查询相关性的指导下,ReUnit 在多个呈现粒度上构建和分配视觉单元。更相关的内容会得到更好的呈现,而更广泛的上下文会被更紧凑地呈现。它使用携带一、四个或九个源帧的视觉单元来实现这些粒度,并且每个视觉单元都渲染为标准图像。在四个基准测试和从 4 到 32 个单位的视觉输入预算中,ReUnit 在每个测试预算中都获得了最高的平均得分。它比均匀采样平均提高了 8.3--10.1 个点,并且增益可转移到另外三个视频 MLLM 系列。项目资源可在 https://github.com/charon525/ReUnit 获取。