论文

PLAW-VLA:视觉-语言-行动策略的预测潜在世界建模

PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies

模型架构模型推理应用与实践混合架构推理加速机器人

摘要

学习预测世界如何演变可以为视觉-语言-行动(VLA)政策提供具有预测背景的长期控制,但其有效性取决于未来表征的建模方式以及它如何影响行动的生成。我们引入了 PLAW-VLA,它在预训练的面向预测的表示空间中对与任务相关的未来状态进行建模,从而减少了预测与控制无关的视觉细节的需要。 PLaW-VLA 建立在 Mixture-of-Transformers 架构之上,根据观察历史、当前任务语义来调节动作生成,并通过结构化因果注意力来预测未来状态。实验表明,RoboTwin Hard Horizo​​n III 上的反应性策略获得了 +11.8 个百分点 (pp) 的增益,而零样本 LIBERO-Plus 上的重建导向的潜在预测则获得了 +1.77 个百分点 (pp) 的增益,分别支持改进的长范围控制和分布偏移下的泛化。通过避免低级视觉重建,PLaW-VLA减轻了未来预测的负担,实现了具有并行未来的轻量级潜在世界模型 预测,并且在可比较的政策性能下,生成世界行动模型的推理延迟约为 1/19。