论文

每帧一个词元:重新考虑 VLA 策略的世界模型中的视觉带宽

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

摘要

视觉-语言-动作(VLA)模型可以使用视觉预测来预测未来状态,但密集的视觉特征使得生成序列随着摄像机视图数量、预测范围和编码器分辨率的增加而增长。目前尚不清楚这种密集的表示是否是有效控制所必需的。我们引入了 OneWM-VLA,它代表每个保留的摄像机视图,每个未来步骤都有一个预测标记。自适应注意力池将视觉特征压缩为紧凑的潜在特征,这些潜在特征是在条件流匹配目标下与机器人动作联合生成的。未来的观察提供了训练期间的潜在目标,并且在推理时不需要。该设计将视觉预测纳入预训练的 VLA 策略中,同时保持生成序列紧凑。在 MetaWorld~MT50 上,OneWM-VLA 将 $π_0$ 主干网的平均成功率从 $47.91\%$ 提高到 $61.53\%$,经过 60k 训练步骤后达到 $72.01\%$。相对于 $π_0$,它还在 LIBERO 上取得了 $98.1\%$ 的成功,并将 Fold Cloth 在真实 Piper 手臂上的成功从 $20.0\%$ 提高到 $60.0\%$。在评估的检查点中,对另外两个 VLA 主干的比较始终倾向于使用一种词元而不是三种词元。较长行动范围内的匹配消融进一步表明,消除潜在损失会将成功率从 $58.09\%$ 降低到 $21.64\%$,支持未来政策学习监督的好处。