论文
词元级视频强化学习
Token-Level Video Reinforcement Learning
摘要
用于视频生成的强化学习 (RL) 通常会为整个采样视频分配一个标量奖励。然而,视频并非都是有缺陷的:一些视觉词元可能已经满足提示,而另一些则需要纠正。标量奖励无法定位错误,导致优化扰乱令人满意的词元,同时未瞄准实际需要更改的词元。我们引入了词元级视频强化学习(TVRL),这是一个从优化的奖励中获得词元级信用的框架。我们的主要见解是,冻结视觉语言模型的答案可能性提供了两种信号:其输出有助于视频级奖励,而其视频输入梯度的大小揭示了哪些生成的视频标记对分数影响最大。我们在组相对策略优化中实例化 TVRL,通过将提示衍生的问题奖励平均化为一个组相对优势,并使用分离的、问题条件的词元信用图来重新加权修剪策略比率内的密集去噪转换对数概率。在 VBench-2.0 上,TVRL 的总体得分为 57.69,比基础模型高出 3.60 分。 TVRL 还将三个 SDE 采样器(SAGE、Flow 和 Dance)的匹配 GRPO 基线提高了 2.68--3.15 点,将四种奖励模型(VideoAlign、VideoScore2、UnifiedReward2 和 Qwen3.5-9B)的匹配 GRPO 基线提高了 1.33--3.15 点。