论文
强化视频理解的结构化思维链
Reinforcing Structured Chain-of-Thought for Video Understanding
摘要
多模态 大语言模型 (MLLM) 在视频理解方面显示出前景。然而,即使通过组相对策略优化 (GRPO) 等强化学习 (RL) 技术进行增强,他们的推理也经常会受到思维漂移和时间理解能力薄弱的影响。此外,现有的强化学习方法通常依赖于有监督的 微调 (SFT),这需要昂贵的思想链 (CoT) 注释和多阶段训练,并强制执行固定的推理路径,限制了 MLLM 的泛化能力并可能引发偏差。为了克服这些限制,我们引入了摘要驱动强化学习 (SDRL),这是一种新颖的单阶段 RL 框架,它通过利用结构化 CoT 格式来消除对 SFT 的需求:总结 -> 思考 -> 回答。 SDRL 引入了两种集成到 GRPO 目标中的自我监督机制:1)视觉知识一致性(CVK)通过减少生成的摘要之间的 KL 分歧来强化事实基础; 2)动态多样性推理(DVR)通过基于群体准确性动态调节思维多样性来促进探索。这种新颖的整合有效地平衡了对齐和探索,监督最终答案和推理过程。我们的方法在七个公共 VideoQA 数据集上实现了最先进的性能。