论文
查看更多,思考更深:用于长视频理解的查询扩展视觉证据和答案线索引导反思
See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding
摘要
Video 大语言模型 (Video-LLM) 的最新进展实现了长视频理解任务的性能。然而,现有方法仍然面临两个关键限制:证据获取通常依赖于单一搜索意图,答案生成缺乏有效的视觉反馈机制。为了解决这些限制,我们提出了 \textbf{CoVER},一个用于长视频理解的综合视觉证据和反射框架。 CoVER 使 Video-LLM 通过动态收集查询扩展的视觉证据来 \textbf{See More},并通过有效的特定于答案的视觉反馈验证草稿答案来 \textbf{Think Deeper}。这些机制共同将长视频理解从以答案为中心的生成转变为以证据为中心且可视觉验证的推理。实验结果表明,CoVER-7B 大大优于具有相同参数规模的模型,甚至在某些指标上超过了最先进的闭源模型。