论文

通过角色感知联合训练和模态解耦去噪增强视频物理一致性

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

模型训练监督微调与指令调优

摘要

虽然现代视频扩散模型在视觉保真度方面表现出色,但保持远程物理一致性仍然是一个艰巨的挑战。传统的像素重建目标主要关注外观细节,通常无法捕捉场景的潜在动态。为了缓解这一问题,最近的努力集成了辅助模式(例如光流),通过与视频外观的联合训练来引入物理先验。然而,这些方法存在三个主要局限性:(1)它们没有区分不同实体类型的不同运动模式; (2)视觉和辅助模态的联合建模会导致容量冲突并削弱预训练的视觉先验; (3)辅助模态可能在推理过程中累积错误。为了解决这些问题,我们提出了 \textbf{VPT},一个 微调 框架,用于提高视频扩散模型的物理一致性。 VPT引入了角色感知信号,将实体分为代理、受控对象、被动对象和背景,以便可以更清晰地建模不同的物理角色。我们进一步提出了一种模态解耦去噪策略,其中视觉通道和辅助通道被分配独立的噪声水平。与失重衰减策略一起,这种设计使辅助模态充当软约束而不是强依赖性,从而减轻推理过程中的递归预测错误。我们还引入了跨步自动引导,以进一步增强物理动力。实验表明,VPT 在保持视觉质量的同时提高了物理一致性,在 VideoPhy 基准测试中相对于 Wan2.1-T2V-1.3B 在 SA 中相对提高了 39.4%,在 PC 中相对提高了 17.9%,并且在 VideoPhy-2 基准测试中得到了一致的改进。项目页面位于 https://tom-zgt.github.io/VPT。