论文
Proprio:潜在的自我评分和推理时间细化,用于生成物理上合理的视频
Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation
摘要
现代视频生成模型产生令人印象深刻的视觉结果,但经常违反基本的物理原理。我们提出 Proprio,一个 无需训练 框架,使冻结视频生成器能够评估和提高其自身输出的物理合理性。受到本体感觉(对自身运动的生物感觉)的启发,Proprio 将模型在受控潜在扰动下的血流残差视为自评分信号。通过生成器学习的动力学更好地解释的样本会产生更小且更稳定的残差。我们跨时间步长和扰动聚合该信号,将其集中在具有动态时空掩模的运动相关区域,并将其用于最佳 N 搜索、基于梯度的自细化或两者。在文本到视频和图像到视频基准测试中,Proprio 不断提高物理合理性,在多种设置中优于基于 VLM 的评分和外部世界模型基线。借助 TurboWan2.2,Proprio 将Physics-IQ 从 32.2 提高到 37.5 (+16.5%),将 VideoPhy2-hard 物理常识从 45.6 提高到 55.0 (+20.6%)。人类评估进一步表明,在大约三分之二的比较中,评估者更喜欢 Proprio 选择或精炼的视频,以实现物理合理性。这些结果表明,冻结视频生成器包含可操作的内部信号,用于评估和提高其自身输出的物理合理性。