论文

RewardVerse:视频奖励建模的标题引导策略优化

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

模型训练奖励建模与过程监督

摘要

强化学习 (RL) 对于优化视频生成模型至关重要,而稳健的奖励模型 (RM) 是其基石。然而,现有的视频奖励模型通常会产生不稳定的标量分数,因为它们直接将复杂的主观视频质量映射为单个分数,而没有明确的评估标准。这会导致标量漂移,即评分范围崩溃或在不同提示之间发生变化,从而使强化学习的奖励变得不可靠。受到专业人类注释工程的启发,我们通过 RewardVerse 解决了这个问题,这是一个基于评分标准的视频奖励框架,它引入了动态评分标准作为评估查询和评分器之间的中间表示。 RewardVerse 不是无约束的直接评分,而是首先生成明确的评估标准,然后执行评分细则引导的评分,提供稳定的语义锚来减轻标量漂移。为了有效地优化这个协作管道,我们提出了 Rubric 引导策略优化(RGPO),这是一种两阶段训练算法。 RGPO 首先使用自我进化的种子评分标准来预热评分器,然后联合优化评分标准生成器以生成查询自适应评估标准,同时不断使评分器与人类评分保持一致。对 16 维 EvalVerse 基准和外部数据集进行的大量实验表明,RewardVerse 可以减轻标量漂移,在逐点和成对评估方面实现最先进的性能,并为视频生成中的 RL 提供强大且可解释的奖励信号。