论文
KVPO:ODE-Native GRPO,通过 KV 语义探索进行自回归视频对齐
KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
摘要
让流式自回归 (AR) 视频生成器与人类偏好保持一致具有挑战性。现有的强化学习方法主要依赖于基于噪声的探索和基于 SDE 的代理策略,这些策略与精炼 AR 模型的确定性 ODE 动态不匹配,并且往往会扰乱低级外观,而不是对长期一致性至关重要的高级语义故事情节进展。为了解决这些限制,我们提出了 KVPO,这是一种 ODE 原生在线组相对策略优化 (GRPO) 框架,用于对齐流视频生成器。对于多样性探索,KVPO 引入了因果语义探索范式,将变异源从随机噪声重新定位到历史 KV 缓存。通过随机路由历史 KV 条目,它构建了严格保留在数据流形上的语义多样化的生成分支。对于策略建模,KVPO 引入了基于轨迹速度能量 (TVE) 的速度场代理策略,该策略量化流匹配速度空间中的分支可能性,并产生与本地 ODE 公式完全一致的奖励加权对比目标。对多个精炼 AR 视频生成器进行的实验表明,在单提示短视频和多提示长视频设置中,视觉质量、运动质量和文本视频对齐方面都有一致的提升。