论文
地面、覆盖和细化:长视频问答的以证据为中心的帧选择
Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering
摘要
长视频问答需要在视觉受限的情况下从包含数千帧的视频中识别稀疏但关键的证据 - 词元预算。现有方法要么在一次传递中选择查询感知帧,要么仅依赖带时间戳的文本作为检索指导,从而导致两个关键限制。首先,选定的框架往往聚集在局部相关性峰值周围,一旦预算耗尽,遗漏的证据就无法恢复。其次,文字和视觉证据的一致性仍然很弱。我们提出了 GCR,一个 无需训练 框架,它将固定预算框架选择作为联合证据管理问题。 Ground 将带时间戳的文本转换为时间事件,选择与查询相关的真实帧锚点,并将每个事件文本渲染到其时间对齐的帧上。Cover通过直接视觉锚来补充时间对齐的事件,以补充视觉证据,并应用全局最大边际相关性来保留多样化的背景。 Refine 重新审视省略的时间区域,并用真实帧中心点替换最弱的可修订上下文帧,但前提是该中心点提供更大的证据价值。 GCR 维护固定数量的按时间顺序排列的帧,并且不需要 VLM 训练或架构修改。在 LongVideoBench 和 Video-MME 上进行的实验,跨越三个 7B 主干和 8、32 和 64 帧预算,证明了长视频 QA 的持续改进。凭借 7B LLaVA-OV 主干和 32 帧,GCR 在两个基准测试中达到 64.25% 和 62.15%,分别比最强的再现基准高出 2.54 和 1.93 个百分点。