论文

PhyCo:学习生成运动的可控物理先验

PhyCo: Learning Controllable Physical Priors for Generative Motion

模型训练监督微调与指令调优

摘要

现代视频扩散模型擅长外观合成,但仍然难以实现物理一致性:物体漂移、碰撞缺乏真实的反弹,并且材料响应很少与其基本属性相匹配。我们提出了 PhyCo,一个将连续的、可解释的、基于物理的控制引入到视频生成中的框架。我们的方法集成了三个关键组成部分:(i) 超过 100K 个逼真模拟视频的大型数据集,其中摩擦、恢复、变形和力在不同场景中系统地变化; (ii) 使用以像素对齐的物理属性图为条件的 ControlNet 的预训练扩散模型的物理监督 微调; (iii) VLM 引导的奖励优化,其中微调的视觉语言模型通过有针对性的物理查询来评估生成的视频,并提供可微分的反馈。这种组合使生成模型能够通过物理属性的变化产生物理一致且可控的输出,而无需任何模拟器或推理时的几何重建。在Physics-IQ基准测试中,PhyCo在强基线上显着提高了物理真实感,人体研究证实了对物理属性的更清晰、更忠实的控制。我们的结果展示了一条通往物理一致、可控的生成视频模型的可扩展路径,该模型可以推广到合成训练环境之外。