论文

Token-World:机器人操作的视觉语言模型词元空间中的世界建模

Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation

模型架构新型架构

摘要

视觉-语言-动作 (VLA) 系统的世界模型模拟的常见方法是预测未来的 RGB 观察结果,然后将它们重新编码为策略输入,从而在模拟和下游策略执行之间引入间接接口。相反,我们研究世界动态是否可以在源自 VLM 视觉词元的紧凑的、面向策略的状态中建模。一个关键的挑战是原始 VLM 视觉词元是高维的,这使得高效且准确的自回归动力学建模具有挑战性。为了解决这个问题,我们引入了 Token-World,一种以动作为条件的世界模型,它将 VLM 特征压缩为紧凑的词元状态,在这个缩小的空间中学习未来的动态,并将预测状态映射回原始的面向策略的表示以供下游使用。在操纵基准中,Token-World 比最近的世界模型模拟器提高了开环特征保真度和策略操作一致性,并且在长期部署范围内退化速度较慢。在闭环评估中,其模拟策略性能与参考策略性能的相关性比 Ctrl-World 更强($r=0.794$ vs.\ $0.583$),同时要求较低的模拟延迟。消融进一步表明,紧凑表示设计和维度极大地影响未来状态预测。代码可在 https://chuyaofu.github.io/Token-World/. 获取