论文
CoRe:共同进化的奖励模型,用于减轻视频扩散模型中的潜在奖励黑客攻击
CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models
摘要
潜在奖励模型 (LRM) 通过直接在潜在空间中对中间状态进行评分,实现视频扩散模型的有效对齐。然而,我们发现针对固定潜在奖励进行优化会迅速导致潜在奖励黑客行为:预测奖励保持较高水平,而感知和运动质量却恶化。我们的分析将分布逃逸确定为核心原因:在数百次更新内,生成器超出了奖励模型的训练支持,其分数不再反映视频质量。基于这一见解,我们引入了 CoRe,一个共同进化的奖励框架,它将潜在空间对齐视为生成器和奖励模型之间的动态交互。 CoRe 不是针对固定代理进行优化,而是不断地根据生成器的当前样本重新调整奖励模型,同时将其锚定到真实视频偏好,因此生成器无法通过偏离数据来获得奖励。在 Wan2.1-T2V-1.3B 上,实验表明,CoRe 相对于预训练模型和先前的对齐方法持续提高了生成质量,同时避免了固定奖励优化的质量崩溃。