论文

视频证据索引:学习从视频预览中查看何处以进行词元预算的长视频问答

Video Evidence Indexing: Learning Where to Look from Video Previews for Token-Budgeted Long-Video Question Answering

上下文与知识上下文工程

摘要

长视频问答受到视觉词元的高成本和当前 VLM 的固定上下文宽度的限制。长视频问题可能需要广泛的时间覆盖,但答案通常仅由一组紧凑的时刻支持。为了有效地定位这些时刻,我们提出了词元预算视频证据索引(VEI):给定密集的低分辨率视频预览,该模型构建一个紧凑的高分辨率证据集以进行最终推理。我们将 VEI 视为一项策略,必须共同解决 evidence localization(找到问题相关时刻)和 budget planning(决定将有限的高分辨率帧预算花在哪里)。我们通过推理管道实现这个想法:视频预览提供廉价的全局覆盖,视频证据索引构建证据集,答案生成结合最终 VQA 的两个输入。为了解决帧级监督缺失的问题,我们采用特权自蒸馏,其中有答案意识的教师指导学生生成的索引跟踪的正常测试时间策略。我们探索每帧 1、6、12 和 24 个视觉词元的预览,训练支持所有四种分辨率的单个策略。实验表明,视频证据索引在有限的视觉预算下提高了准确性,而自蒸馏进一步提高了 QA 准确性和时间证据定位。