论文
DiReCT:用于物理精炼视频生成的对比轨迹的解缠正则化
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
摘要
流匹配视频生成器产生时间连贯的高保真输出,但通常违反基本物理,因为它们的重建目标会惩罚每帧偏差,而不区分物理一致的动态与不可能的动态。对比流匹配通过推开不同条件下的速度场轨迹提供了原则性的补救措施,但我们发现了文本条件视频设置中的一个基本障碍:语义物理纠缠。由于自然语言提示将场景内容与物理行为结合起来,因此朴素负采样会绘制速度场与正样本的速度场很大程度上重叠的条件,从而导致对比梯度直接与流匹配目标相反。我们将这种梯度冲突形式化,得出精确的对齐条件,揭示对比学习何时有助于训练,何时有害训练。在此分析的指导下,我们引入了 DiReCT(对比轨迹的解缠正则化),这是一个轻量级的 后训练 框架,它将对比信号分解为两个互补的尺度:一个是宏观对比项,它从语义上遥远的区域中提取分区独占负例,以实现无干扰的全局轨迹分离;另一个是微观对比项,它构造与正样本共享完整场景语义但沿单个、 LLM-身体行为的扰动轴;涵盖运动学、力、材料、相互作用和大小。速度空间分布正则化器有助于防止灾难性地忘记预先训练的视觉质量。当应用于 Wan 2.1-1.3B 时,与基线和 SFT 相比,我们的方法在 VideoPhy 上的物理常识分数分别提高了 16.7% 和 11.3%,而无需增加训练时间。