论文
将物理先验提炼为流世界模型
Distilling Physical Priors into Streaming World Models
摘要
流世界模型在线预测未来的视觉状态,同时在长期范围内保持物理连贯的动态。然而,它们的生成轨迹常常违反基本的物理限制。一种常见的方法是将预训练的双向 DiT 提炼成几步因果生成器。然而,这种范式存在两个基本限制:通用双向教师从面向视觉的预训练中获得有限的物理先验,而有限的先验在双向到因果 蒸馏 过程中遭受进一步损失。我们提出了 PhyS,一个三阶段框架,用于将物理先验提炼成流世界模型。为了从现实世界的交互中获取物理先验,我们构建了 PhyS-120K,这是一个包含 120K 个现实世界物理交互视频的数据集,涵盖刚体动力学、软体变形、流体现象和相变。每个视频都配有对象属性和因果状态转换的结构化描述。物理感知监督 微调 将物理先验注入双向 14B DiT 教师,然后我们将其提炼为轻量级 1.3B 因果 DiT,用于几步自回归流生成。最后,我们使用在线强化学习来激励蒸馏模型生成物理上合理的生成轨迹,并进一步提出时序信用路由(TCR)来解决时序信用分配问题。 TCR 评估重叠时间窗口上的物理一致性,并将所得的组相对优势路由到时间对齐的去噪操作。在PhysicsIQ上,PhyS将Wan2.1-14B教师提高了18.2%,将自我强迫、滚动强迫和因果强迫分别提高了23.7%、14.8%和31.4%。结果还改进了物理感知视频基准 VideoPhy、VideoPhy2 和 PhyGenBench。我们的项目页面上提供了数据集、代码和更多示例视频。