论文
通过反事实强化学习学习视频 LLM 中的时空敏感性
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning
摘要
视频 大语言模型(视频 LLM)可以实现强大的视频 QA 准确性,而无需可靠地跟踪时空动态。例如,模型可以根据静态提示回答运动问题,即使在底层运动反转后也能给出相同的预测。基于正确性的强化学习并不能直接解决这个问题,因为它奖励最终答案,而不需要策略响应与任务相关的视频动态。我们提出了反事实关系策略优化(CRPO),它明确地训练视频 LLM 以响应视觉输入中的受控变化。对于每个训练示例,CRPO 都会构建一个反事实视频,例如原始视频的水平翻转或时间反转版本,并在共享策略下联合优化两个视频的采样轨迹。事实监督锚定了模型应该回答的内容,而反事实监督则限制了答案何时应该改变:当干预改变与任务相关的动态时,预测应该改变,而当查询的属性被保留时,预测应该保持稳定。这种耦合提供了直接的行为学习信号,不需要转换视频的 真值 标签或带注释的时空推理轨迹,同时阻止不加区别的答案更改。为了评估这一属性,我们引入了 DyBench,这是一个具有 3{,}014 个视频的配对反事实基准和严格的配对准确度指标。通过配对时空评估和标准视频基准,CRPO 提高了对运动和时间变化的敏感度,同时提高了一般视频理解的性能。收益还延伸到了片段重新排序,这是一种在训练期间从未使用过的转换,这表明 CRPO 在训练干预之外学习了对视频动态的敏感性。该项目网站可以在 https://ddz16.github.io/crpo.github.io/ 找到。