论文

查找、修复、推理:视频推理的上下文修复

Find, Fix, Reason: Context Repair for Video Reasoning

模型训练强化学习

摘要

强化学习在大型多模态模型中具有先进的视频推理能力,但主要管道要么依赖于 同策略 自我探索(在模型的知识边界处趋于稳定),要么依赖于混合策略并需要仔细正则化的混合重放。动态上下文方法放大了重点证据,但通常需要精心策划的预训练和两阶段调整,并且它们的上下文仍然受到小模型能力的限制。相比之下,较大的模型擅长指令遵循和多模式理解,可以为较小的模型提供更丰富的上下文,并通过简单的工具快速放大目标区域。在此功能的基础上,我们引入了观察级干预:冻结的、工具集成的教师识别缺失的时空依赖性,并在问题保持不变的情况下从原始视频中提供最小的证据补丁(例如时间戳、区域等)。学生再次回答添加的上下文,并使用集成到组相对策略优化 (GRPO) 中的所选采样轨迹方案进行训练更新。我们进一步提出了一个稳健改进奖励(RIR),它将优化与两个目标保持一致:通过正确答案的结果有效性和通过反映引用证据的理由进行依赖性调整。优点是跨批次进行组标准化,保留 同策略 探索,同时将其引导到因果有意义的方向,并对训练堆栈进行最小的更改。各种相关基准的实验显示出一致的准确性增益和很强的泛化性。代码可在 https://jethrojames.github.io/FFR/ 获取。