论文
PhysLayer:具有深度感知物理功能的语言引导分层动画
PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics
摘要
现有的图像到视频生成方法通常会产生物理上难以置信的运动,并且缺乏对对象动态的精确控制。虽然之前的方法已经结合了物理模拟器,但它们仍然局限于二维平面运动,并且无法捕获深度感知的空间交互。我们介绍 PhysLayer,这是一种新颖的框架,支持语言引导、深度感知的静态图像分层动画。 PhysLayer 由三个关键组件组成:首先,语言引导的场景理解模块,利用视觉基础模型通过分析对象组成、材料属性和物理参数将场景分解为基于深度的层。其次,深度感知分层物理模拟通过深度运动和透视一致的缩放来扩展 2D 刚体动力学,从而无需完整的 3D 重建即可实现更真实的对象交互。第三,物理引导的视频合成模块将模拟轨迹与场景感知重新照明相结合,以获得时间相干的结果。实验结果表明,CLIP-相似性 (+2.2\%)、FID 分数 (+9.3\%) 和 Motion-FID (+3\%) 均得到改进,人类评估显示物理合理性 (+24\%) 和文本视频对齐 (+35\%) 得到增强。我们的方法为可控图像动画提供了物理真实性和计算效率之间的实际平衡。