论文
VIPER:视觉上下文物理推理,用于生成物理上合理的视频
VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation
摘要
现代视频生成模型可以合成视觉上引人注目且时间连贯的剪辑,但在标准文本和图像条件下控制其物理行为仍然很困难。核心挑战是调节瓶颈:材料响应、接触交互、变形和运动轨迹是连续且相关的物理线索,很难用语言详尽地指定,但可以通过视频自然地演示。我们提出了 VIPER,一种用于参考引导图像到视频生成的视觉上下文物理推理框架。给定目标图像、简短的目标提示和参考视频,VIPER 会将参考视为所需物理过程的密集视觉演示,而不是外观模板。它使用多模态 大语言模型 (MLLM) 提取源自参考的物理线索,并通过分层训练策略指导预训练的图像到视频生成器,从而实现物理行为迁移,同时保留基本生成器的视觉先验。为了支持这种设置,我们构建了 VIPER-19K,这是一个包含材料、轨迹和物理影响注释以及过滤的参考目标对的精选数据集。在未见过的验证集上进行的实验表明,与代表性视频生成和视频提示基线相比,VIPER 实现了更强的参考视频物理相似性和更高的人类偏好,同时保持了具有竞争力的总体视频质量。定性结果进一步表明,VIPER 可以将参考衍生的物理行为转移到新的目标场景,而无需精心设计的提示。