论文
VideoScout:通过自适应推理节奏学习代理主动探索以实现长视频理解
VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding
摘要
多模态大语言模型(MLLM)在短视频理解方面取得了显着进展,但由于视觉上下文窗口有限,在长视频理解方面仍然受到限制。流行的方法依赖于统一的帧采样或最近从粗到细的代理缩放,这两种方法都难以在足够长的视频中定位稀疏的、决定性的证据。我们将长视频理解表述为一个 \textbf{顺序证据获取 (SEA)} 问题,其中代理沿着时间轴依次读取视频,决定每次观看的速度、保留哪些证据、何时重新访问不确定的片段以及何时停止并回答。受这一观点的启发,我们提出了 \textbf{VideoScout},一种多轮推理代理,它通过自适应推理节奏实例化 SEA 范式。具体来说,通过动态控制观看速度,VideoScout 可以在有限的视觉上下文窗口内高效遍历长视频,从而允许代理访问更多视频内容,同时平衡内容分析深度和阅读效率。为了训练 VideoScout,我们构建了 VideoScout-66K,这是一组来自 10K 答案验证轨迹的超过 66K 的高质量探索回合,并采用两阶段管道:冷启动监督微调教导代理每回合输出格式,而解耦剪辑和动态采样策略优化 (DAPO) 算法执行轨迹级强化学习,并具有复合奖励,共同考虑答案准确性、输出格式合规性以及模型之间的时间对齐。智能体的观看进度和教师的回答时间通过交并比 (IoU) 来衡量。对长视频理解和推理基准的大量实验表明,与现有经过训练的 7B 代理模型相比,我们的 7B 模型具有强大的性能。