论文

PhysisForcing:用于机器人操作的物理强化世界模拟器

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

模型训练监督微调与指令调优

摘要

视频生成模型已成为现实世界模拟的一个有前途的范例。然而,通用领域视频生成器和机器人特定数据微调模型仍然可以产生物理上难以置信的操作,包括不连续的运动轨迹和不一致的机器人与物体交互,这限制了它们作为世界模拟器的可靠性。通过大量的实验,我们发现这种物理不稳定性主要源于两个因素:移动物体的变形和相互作用实体之间令人难以置信的时空相关性,特别是在接触过程中。基于这一观察,我们提出了 PhysisForcing,这是一个可扩展的训练框架,通过像素级和语义级特征的联合优化,重点监督物理信息区域,从而增强物理一致性。该框架由像素级轨迹对齐损失和语义级关系对齐损失组成,前者使用参考点轨迹监督 DiT 特征,后者将 DiT 特征与从冻结视频理解编码器提取的区域间关系对齐。在 R-Bench、PAI-Bench 和 EZS-Bench 上进行的大量实验表明,PhysisForcing 在强基线上持续改进了具体视频生成,将 R-Bench 上的 Wan2.2-I2V-A14B 和 Cosmos3-Nano 基础模型改进了 22.3\% 和 9.2\%(比普通微调提高了 7.1\% 和 3.7\%), Cosmos3-Nano 变体获得了最佳总体得分。除了生成之外,作为 WorldArena 行动规划器协议下的世界模型,它将闭环成功率从 16.0% 提高到 24.0%,并进一步提高了下游策略的成功率,这表明物理对齐的视频模型可以为机器人操作提供更强的表示。