论文

从生成轨迹误差定位关键时段:文生视频扩散的隐式偏好优化

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

模型训练偏好优化

摘要

基于扩散的视频生成的偏好对齐的最新进展,特别是通过直接偏好优化 (DPO),显着提高了视觉质量。然而,运动崩溃、物体闪烁和颜色过饱和等时间上稀疏的伪像仍然是感知现实主义的主要障碍。现有方法由于两个关键限制而难以解决这些问题:(1)偏好归因瓶颈,离线人工注释成本高昂且无法准确捕捉学习动态,而在线奖励信号具有生成轨迹感知能力,但往往不稳定且有偏差; (2)时序信用分配错配,均匀施加的监督无法有效针对出现伪影的短暂片段。为了应对这些挑战,我们提出了集中隐式偏好优化(cIPO),这是一个用于视频扩散模型的 后训练 框架。 cIPO 直接从去噪过程中导出隐式偏好信号:给定真实视频,模型添加前向噪声并通过迭代去噪对其进行重构,将原始样本视为首选样本,将重建视为不偏好样本。该公式无需人工注释或外部奖励模型即可捕获推理时间错误。此外,原始视频和重建视频之间的帧级差异可以揭示何时发生故障。 cIPO 通过计算时间重建误差并集中优化高误差段来利用这一点,从而能够更精确地纠正容易出现故障的区域。大量实验表明,cIPO 持续增强了多个数据集的视频真实性和时间一致性,突出了隐式偏好通过时间集中优化的有效性和效率。