论文
LocalDPO 在时空局部区域优化视频生成偏好
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
摘要
让文生视频扩散模型与人类偏好对齐,是生成高质量视频的关键。现有直接偏好优化(DPO)方法依赖多样本排序及任务专用评判模型,效率较低,且往往只能提供含糊的全局监督。为此,我们提出LocalDPO:从真实视频构建局部偏好对,在时空区域层面优化对齐的后训练框架。自动数据流程对每条提示仅进行一次推理即可生成偏好对,无需外部评判模型或人工标注。具体而言,以高质量真实视频为正样本,随机时空掩码对其进行局部破坏,再由冻结的基础模型仅恢复掩码区域,得到对应负样本。训练时采用区域感知DPO损失,将偏好学习限制在被破坏区域,以实现快速收敛。在Wan2.1与CogVideoX上的实验表明,相较其他后训练方法,LocalDPO持续改善视频保真度、时间一致性和人类偏好评分,为视频生成器对齐提供更高效、细粒度的方法。