论文

视觉-语言-动作模型能否持续从现实世界的数据中学习而不会忘记?

Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?

模型训练持续学习

摘要

视觉-语言-动作(VLA)模型为通用机器人技术提供了一个有前景的基础,但它们在现实世界中的部署要求能够不断获得新技能而不忘记以前的技能。虽然最近的研究探索了 VLA 模型在模拟环境中的持续学习,但在现实的物理条件下,这一挑战在很大程度上仍未得到检验。为了弥补这一差距,我们构建了一个现实世界的持续学习基准,其中包括十个跨单臂和双手配置的不同顺序操作任务。通过对该基准的大量实验,我们发现简单的顺序 微调 会导致严重的灾难性遗忘,而配置良好的经验重放(ER)方法可以有效地减轻遗忘,并在同等计算预算下优于联合多任务训练。值得注意的是,通过综合我们的实证研究结果,我们成功地在整个 10 任务异构流中实现了稳定的持续学习,保留了之前获得的能力,同时适应现实世界部署中的各种新技能。这项工作提出了一项基于现实世界持续 VLA 学习的实证研究,并为部署稳健、长期的机器人策略提供了可行的见解。