论文
Reflect-R1:长视频理解中用于自我校正的证据驱动反思
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
摘要
当前用于长视频理解的多模态反射机制主要依赖于内部参数内的闭环自反射。由于缺乏客观的外部证据,模型经常陷入盲目自信,并且常常无法纠正错误。此外,将强化学习应用于多阶段反射管道会引入严重的策略耦合,而专用训练数据的严重缺乏会加剧这种耦合。为了解决这些限制,这项工作提出了 Reflect-R1,这是第一个用于长视频理解的证据驱动的自我校正框架。该框架构建了一个由直觉、验证和仲裁组成的三级管道。通过动态检索客观视觉证据来验证最初的直觉并自主执行多个时间搜索来解决冲突,它完全打破了幻觉循环。为了克服策略耦合,我们设计了一种名为 SD-GRPO 的阶段解耦强化学习算法,该算法可以独立计算不同推理阶段的优势函数。同时,我们构建了一个包含 12 万个样本的数据集,以弥补训练数据的差距。对 VideoMME 和 LongVideoBench 等基准测试的大量实验表明,Reflect-R1 实现了最先进的性能。我们的方法显着提高了真实纠正率,并能够严格基于客观证据进行真实的自我纠正。