论文
CompAdapt:用于物理一致的文本到视频生成的自适应复合运动建模
CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
摘要
虽然基于扩散的文本到视频(T2V)模型在生成逼真且时间连贯的视频方面表现出了令人印象深刻的能力,但它们往往无法尊重基本的物理动力学。尽管最近的物理约束方法结合了显式动力学先验来提高物理合理性,但它们仍然仅限于简单的单一类型运动,依赖于手动指定的参数,并且难以推广到看不见的物理定律。在这项工作中,我们提出了 CompAdapt,这是一种物理一致的 T2V 框架,用于跨复杂的现实场景进行适应性生成。它将神经动力学建模扩展到单一类型运动之外,涵盖复合物理行为,包括耦合运动、多阶段转换和多对象碰撞。此外,CompAdapt 将自然语言提示转换为结构化物理语义,从而实现运动类型、时间关系和初始物理参数的端到端规范。为了推广到新的物理环境,CompAdapt 引入了动态感知先验匹配,无需重新训练核心动态模块即可实现一次性适应。此外,物理感知的潜在特征融合模块提高了快速复杂运动下的视觉保真度。以物理为重点的 T2V 基准测试表明,CompAdapt 相对于一般 T2V 模型和物理约束基线提高了物理一致性,同时保持了高视觉质量和对不可见动态的适应性。项目页面可通过此 https URL 获取。