论文

迈向类人物理智能:机器人操作的终身视觉-语言-动作学习

Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation

模型训练持续学习

摘要

与人类连续学习新任务的自然能力类似,具有视觉-语言-动作(VLA)模型的机器人应该具备终身学习能力,在开放世界环境中部署时能够学习新任务。然而,最近提出的终身学习模型旨在有效地学习当前任务(可塑性)或保持先前任务的高精度(稳定性),而可塑性与稳定性的权衡在机器人操纵模型中很大程度上仍未得到解决。为了解决这一根本挑战,我们提出了一种用于机器人操作的缓存高效的终身视觉-语言-动作学习框架(即LifelongVLA),它通过双时间尺度适应机制减轻了可塑性与稳定性的权衡,同时通过缓存高效的重放策略实现了低成本的机器人部署。更具体地说,我们提出了一个双时间尺度 LoRA 门控模块,将 VLA 适应分解为两个轻量级路径:用于可塑性的短期适配器和用于稳定整合的长期适配器。这些途径通过任务感知门进行集成,从而能够明确控制可塑性与稳定性的权衡。在技​​能重放阶段,提出了一种高效缓存的随机重放策略,以在无需全轨迹存储的情况下保留更平衡的保留信号。最后,实验表明 LifelongVLA 优于现有基线,展示了高效的技能扩展、对所学操作行为的稳健保留,以及减少了在 xArm 机器人上进行实际部署时对再训练的依赖。