论文
OneWorld:让不同行动下的未来共享同一物理机制
OneWorld: Learning Consistent Physics Across Actions in World Models
摘要
动作条件视频世界模型旨在预测不同动作下的场景演变,这种能力对于动态环境中的可靠规划、决策和交互至关重要。然而,从同一初始场景独立生成的未来可能看起来都是合理的,但同时意味着不兼容的物理属性,例如摩擦力或质量。这种不一致可能会导致干预措施之间的预测相互矛盾,使模型难以保持对底层世界的连贯理解,并限制其规划和决策的可靠性。为了解决这些问题,我们提出了 OneWorld,这是一种共享机制反事实生成框架,它在共同的潜在物理机制下联合建模多个动作条件的未来。物理机制解释器首先从每个动作结果分支推断潜在机制的分布。然后,这些分布被聚合成共享世界的证据,该证据捕获分支是否容许共同的物理解释,同时考虑信息较少的分支的不确定性。这一证据限制了流模型训练并指导采样,鼓励潜在物理机制的一致性,同时保留不同动作引起的不同结果。我们进一步在受控环境中引入多干预评估协议,遵循 ACWM-Phys 的交互设置,以评估所生成的未来是否可以由相同的物理参数以及单条轨迹展开预测质量的标准度量共同解释。这些环境中的实验表明,OneWorld 提高了交叉干预的物理一致性,同时保持了具有竞争力的单条轨迹展开预测质量。
