论文
当物理偏好满足语义约束时:文本到视频生成的物理和语义直接偏好优化
When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation
摘要
文本到视频(T2V)生成模型已经实现了很强的视觉真实感,但提高物理合理性可能会以牺牲与输入文本的语义一致性为代价。出现这种紧张的原因是,身体偏好通常是通过比较两个视频之间的动态来确定的,而不考虑任何一个视频是否忠实地描绘了提示指定的场景,使得物理语义冲突成为这种监督范式下的系统趋势。我们将这一挑战表述为约束偏好优化问题,并提出物理和语义直接偏好优化(PSDPO),它根据其物理和语义信号之间的一致性来调节每个偏好对的贡献。梯度级分析表明,PSDPO 将冲突对的语义漂移限制为可控残差,并进一步激发了分阶段优化协议,该协议可证明减少累积漂移。由此产生的方法完全在标准 DPO 框架内运行,不需要辅助模型或额外的损失项。实验表明,PSDPO 与 VideoPhy-2 上的基线相比,物理合理性提高了高达 $2\times$,同时在 VBench 上保持了强大的语义一致性,实现了比现有基于偏好的方法更可靠的平衡。