论文

STEER:通过多目标强化学习进行视频推理的结构化事件证据

STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning

模型训练强化学习

摘要

人类对视频动态的理解依赖于在进行抽象推理之前形成实体、动作和时间关系的结构化表示。相比之下,现有的 Video-LLM 将非结构化思想链直接应用于原始视觉标记,其中关键的时间线索被埋藏在冗长的叙述中,而事件级结构在很大程度上被忽视。我们提出了结构化事件证据,它将视频表示为紧凑的、按时间排序的事件模式,捕获具有关键属性和事件间时间依赖性的显着事件,从而通过受约束的验证过程实现基于证据的推理。这种设计促进了简洁、可解释的推理,同时减少了不受约束的思维链典型的漂移。为了在这种范式下训练模型,我们引入了 STEER-60K,这是一个具有四阶段渐进式流程的数据集:证据训练、格式热启动、思维热启动和 RL 后训练。在强化学习过程中,CoT 长度和任务准确性经常发生冲突,而硬样本的奖励又太稀疏,导致策略忽略具有挑战性的实例。我们将其表述为多目标帕累托最优问题,并提出帕累托前沿引导优势平衡(P-FAB),它动态解决奖励冲突并识别沿帕累托前沿的平衡优化方向。由此产生的模型 STEER-4B 在视频理解任务上可与 7B 规模的基线相媲美,其中一半的输入帧代码和数据将被发布。