论文
寻找正确的证据:长视频的因素引导粗到细推理
Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
摘要
虽然 LVLM 迅速改进,但长视频问答仍然具有挑战性:相关证据很少,而且与问题相关的上下文通常无法提供区分正确答案和合理答案的线索。对 MMR-V 手动注释子集的诊断分析表明,先前的代理系统相对于直接 VLM 推理大大提高了线索检索,但未能在答案准确性方面实现相应的增益,这表明瓶颈在于选项判别性证据,而不仅仅是主题相关性。我们提出了 PACE(关键证据的渐进式获取),这是一种用于长视频证据获取的因素引导框架。 PACE 分两个阶段进行:首先,在不观察候选答案的情况下,根据问题衍生因素对剪辑级别的描述进行索引;然后,它使用候选答案来得出对比线索并查询索引以进行验证。在具有开源 Qwen3-VL 主干的 MMR-V 上,PACE 实现了 42.6% 的准确率,优于直接推理和包括 Deep Video Discovery (DVD) 在内的先前代理基线。在同一诊断子集上,PACE 恢复了 66.9% 的带注释线索,提供了经验证据,表明其收益与改进的证据恢复相关,而不仅仅是与更强的答案方先验相关。在 LVBench、Video-MME、EgoSchema 和 LongVideoBench 上持续优于 DVD 的结果表明,选项感知证据获取超越了 MMR-V。代码可在 https://github.com/HKUST-KnowComp/PACE 获取。