论文

LOVER:从长到短的视频证据训练支持可定位问答

Long-to-Short Video Evidence Reasoning for Grounded Question Answering

模型训练强化学习

摘要

我们提出 LOVER,一个从 \underline{L}ong 到 sh\underline{O}rt \underline{V}ideo \underline{E}vidence \underline{R} 强化的基础问答(GQA)模型。 LOVER重点介绍了现有基于强化学习(RL)的视频推理模型的三项创新:(1)\textbf{长到短的视频证据课程学习},根据证据时长组织强化学习训练,逐步使模型从长期落地到短期推理; (2) \textbf{GQA 奖励},它强调了 IoP 奖励相对于 IoU 在证据发现方面的优势,而不是严格的时间跨度重叠; (3) \textbf{自适应时间戳渲染},它使用背景感知位置和颜色选择将时间戳自适应地渲染到视频帧上,以增强时间可观察性。这三种设计与模型无关并且是相互的。它们有效地提高了不同骨干网的 QA、证据定位和带证据定位的问答 性能。值得注意的是,基于 Time-R1 构建的 LOVER 在流行的 GQA 基准测试(NExT-GQA 和 ReXTime)的开源模型中取得了新的最先进(SOTA)结果。全面的消融研究进一步验证了我们三个创新组件的有效性。