论文
STRIVE:视频问答中强化学习的结构化时空探索
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering
摘要
我们引入了 STRIVE(具有重要性感知变量探索的时空强化),这是一种用于视频问答的结构化强化学习框架。虽然基于组的策略优化方法在大型多模态模型中表现出了良好的前景,但当响应表现出类似的正确性时,它们通常会受到低奖励方差的影响,从而导致优势估计较弱或不稳定。 STRIVE 通过构建每个输入视频的多个时空变体并跨文本生成和视觉变体执行联合标准化来解决这一限制。通过将群体比较从语言多样性扩展到结构化视觉扰动,STRIVE 丰富了奖励信号并促进更稳定和信息丰富的政策更新。为了确保探索保持语义基础,我们引入了一种重要性感知采样机制,该机制优先考虑与输入问题最相关的帧,同时保留时间覆盖范围。这种设计鼓励跨互补视觉视角的稳健推理,而不是过度拟合单一时空配置。对六个具有挑战性的视频推理基准(包括 VideoMME、TempCompass、VideoMMMU、MMVU、VSI-Bench 和 PerceptionTest)进行的实验表明,在多个大型多模态模型中,与强大的强化学习基准相比,得到了一致的改进。我们的结果强调了结构化时空探索作为稳定多模态强化学习和提高视频推理性能的原则机制的作用。