论文
世界词元:通过训练时世界建模增强具体政策
World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
摘要
视觉-语言-行动(VLA)模型是广泛采用的具体政策范例。它们擅长高效的闭环控制,但没有明确模拟物理场景如何随着任务的展开而演变。最近新兴的世界动作模型 (WAM) 利用预训练的视频世界模型来捕获时空演化,但在控制循环中保留下一代或大型视频主干会大大增加推理成本。我们引入了世界词元,这是一种围绕世界适配器构建的具身策略架构,可连接视觉语言理解、世界动态建模和动作生成。它在训练期间使用世界建模来增强行动策略,同时保持高效部署。具体来说,世界适配器将 VLM 功能转换为一组固定的世界词元,这些词元调节联合微调的未来视频降噪器,同时充当动作专家的唯一视觉语言上下文。这种共享条件允许未来视频去噪的梯度直接塑造用于动作预测的表示,而独占路由则防止策略绕过该表示。部署时,世界模型分支被删除,只留下VLM、世界适配器和动作专家,没有在线视频模型推理。凭借 2B 主干网且无具体动作预训练,World Tokens 在 LIBERO 上具有高度竞争力,在 SIMPLER 上获得了最佳报告平均值,与匹配的仅动作基线相比,显着提高了现实世界 R1 Pro 的成功率,并以 VLA 级延迟生成每个动作块。