论文
通过视觉-语言-动作模型的多样化经验进行扩展
Scaling by Diversified Experience for Vision-Language-Action Models
摘要
由于高级推理与底层控制的纠缠以及策略优化的不稳定,视觉-语言-动作模型在现实世界的部署中面临着重大挑战。在本文中,我们介绍了 SyVLA,这是一种经过多元化经验训练的稳健 VLA 模型。我们提出了一种意图解耦算法,将与控制相关的特征与推理上下文隔离开来,并提出了一种类似样本引导的 RL 管道,以稳定策略更新并减轻分布变化。对现实世界机器人任务和多模态基准的大量实验表明,与现有方法相比,SyVLA 实现了卓越的任务成功率和更强的分布外泛化能力,同时有效保留了核心视觉语言能力。代码和数据集发布于 \href{https://sy-vla.github.io/}{项目页面}。