论文

Sword:通过 VLA 策略的动态潜在引导将风格稳健的世界模型作为模拟器 后训练

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

模型架构新型架构

摘要

视觉-语言-动作(VLA)模型与世界模型的集成越来越受到关注。一种代表性方法将学习的世界模型视为生成模拟器,从而完全在“想象力”内实现政策优化。然而,当部署为特定环境(例如 LIBERO 基准)的模拟器时,现有的世界模型通常会遇到泛化性差和长期误差累积的问题。在闭环采样轨迹期间,这些模型对初始状态扰动高度敏感;颜色、照明和其他视觉因素的微小变化都会引发连锁幻觉,导致严重模糊或过度曝光。此外,长期误差累积进一步降低了预测未来状态的质量和保真度。这些问题限制了世界模型作为模拟器的可靠性。为了缓解这些问题,我们提出了 Sword,一个强大的世界模型框架。我们的方法引入了结构引导风格增强,将交互式环境的视觉纹理与任务相关的动态分开,从而提高泛化能力。我们进一步提出动态潜在引导,它保持训练和推理之间的一致性,同时保持较低的内存消耗。 LIBERO 基准上的大量实验表明,我们的方法在泛化性、生成质量、鲁棒性、保真度以及 VLA 模型的强化学习 后训练 的成功率方面显着优于基线 WoVR。