论文

并非所有行动都是平等的:重新思考灵巧世界模型的调节

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

模型架构新型架构

摘要

动作条件世界模型的最新进展表明,在复杂交互建模和预测不同动作序列下的未来状态方面取得了有希望的进展。虽然这些模型通常是由更强的视觉表征和模型能力驱动的,但动作调节本身仍未得到充分探索。大多数现有方法将整个动作序列压缩为单个表示,这对于低自由度控制效果很好,但在高自由度场景中变得不太可靠。我们观察到,高自由度灵巧动作本质上是异构的,跨越多个数量级,其中大规模运动与微妙但重要的信号共存。当统一聚合时,优化会表现出动作组件之间的不平衡,这阻碍了细粒度效果的建模并影响动作保真度。因此,我们提出 DexAC-WM,它将动作调节视为结构化过程而不是全局压缩。 DexAC 通过动作标记化保留维度级语义,并通过局部细化和全局调制将动作信号与视觉动态保持一致。为了解决现有世界模型中有限的高级语义基础,我们进一步引入了一个语义分支,它提供了丰富的对象场景先验,使世界模型能够捕获动态视觉细节,同时支持高自由度动作条件视频预测。 EgoDex 和 EgoVerse 上的实验表明,将语义分支与 DexAC 相结合显着改善了 FID、FVD 和 PCK,展示了视觉时间真实性和动作跟踪一致性方面的收益。我们进一步验证 DexAC 是否扩展到其他骨干网,显示了我们结构化动作调节设计的可扩展性。这些结果表明,将世界模型扩展到高自由度控制需要结构化动作建模和语义基础。