论文
EFlow:利用自适应反射进行长视频推理的学习证据流
EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection
摘要
长视频推理从根本上受到模型如何获取和利用视觉证据的限制。现有的工具增强视频框架通常在单个轨迹内交织时序定位和答案推理,导致早期语义假设对证据定位产生偏见。我们将这种失败模式称为过早的语义承诺,其中有偏差的定位检索到不完整的证据,而不完整的证据进一步强化了不正确的推理。为了解决这个问题,我们提出了 EFlow,一个基于 Qwen3-VL 构建的证据优先的视频推理框架。 EFlow 通过 CoT for Temporal Grounding 和 CoT for Reasoning 明确区分时序定位和逻辑推理,使模型能够在答案推理之前检索相关证据。此外,EFlow 引入了一种置信感知反射机制,当检索到的证据可能不足时,该机制会重新评估完整视频。我们进一步构建专用轨迹数据集,并通过监督 微调、强化学习和强化 微调 来训练 EFlow。五个视频理解基准的广泛实验表明,EFlow 持续提高长视频推理性能。