论文
Watch-Think-Interact:通过强化学习引导长视野多轮流视频推理
Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement Learning
摘要
流视频辅助需要模型在固定上下文预算下回答来自观察到的前缀的异步问题。现有的方法对响应时间进行建模或压缩历史记录,但在知道未来问题之前形成的在线状态可以在后续问题揭示其相关性之前省略视觉细节;仅保留状态无法恢复它们。我们引入了 Watch-Think-Interact (WTI),这是一个用于多问题流视频推理的闭环框架。 WTI 维护紧凑的自然语言内存条目,标记有源视频时间范围;这些条目在足够的情况下支持直接推理,否则锚定对更精细的视觉证据的选择性回忆。对于每个问题,WTI 在当前上下文和记忆足够时回答,在未出现所需证据时继续观察,或者回忆过去的相关间隔并在合并返回的块后再次做出决定,而不重放完整的观察到的历史记录。为了训练这种行为,我们构建了 WTI-82K,其中包含 4,812 个因果对齐轨迹中的 82,335 个定时问题,并开发 Stream-GDPO,以使用轨迹级反馈来优化完整的多问题流式部署,以实现响应时间、源视频调用和内存更新。在比较开源流媒体基准中,WTI 实现了最先进的总体性能,在 StreamingBench 上达到 83.3%,在 OVO-Bench 上达到 73.6% 的加权整体准确率。