论文

使用时空场景图证据来规划和验证视频奖励推理

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

模型训练奖励建模与过程监督

摘要

文本到视频 (T2V) 生成的奖励模型可以指导 后训练,但在细粒度语义对齐方面常常失败。我们将其追溯到现有基于推理的奖励模型中的两个结构性弱点:它们没有系统地验证提示中描述的每个条件,并且支持每个判断的视觉证据仍然隐含在其自由形式推理中。我们提出了 SG-PVR,这是一种视频奖励模型,通过基于时空场景图的计划和验证推理来解决这些限制。验证计划将提示分解为原子声明,使要检查的要求集变得明确。从视频中提取编码实体、属性和有时间依据的关系的时空场景图,并在整个推理过程中作为持久的结构化视觉参考进行维护。每个主张都根据视频和场景图进行验证,将判断锚定在明确的视觉证据中。 SG-PVR 在语义对齐方面实现了强大的性能,包括细粒度的时间语义。作为测试时重新排序器,它进一步增强了 T2V 生成中的成分对齐。