论文
CRL-VLA:持续视觉-语言-动作学习
CRL-VLA: Continual Vision-Language-Action Learning
摘要
终身学习对开放世界环境中的具身智能体至关重要,强化学习微调已成为一种重要范式,使视觉-语言-动作(VLA)模型能够通过环境交互掌握灵巧操作。因此,持续强化学习(CRL)是在终身机器人场景中部署 VLA 模型的一条有前景的路径,然而对现有方法而言,在稳定性(保留旧技能)与可塑性(学习新技能)之间取得平衡仍是一项艰巨挑战。我们提出 CRL-VLA,一个具有严格理论界限的 VLA 模型持续后训练框架。我们推导出一个统一的性能界,将稳定性-可塑性权衡与目标条件优势幅值联系起来,并以策略散度加以缩放。CRL-VLA 通过非对称调节化解这一两难:约束先前任务上的优势幅值,同时允许新任务上的优势受控增长。这通过一个简单而有效的双评估器架构与新颖的目标条件价值形式化(GCVF)实现:冻结的评估器锚定语义一致性,可训练的估计器驱动适应。在 LIBERO 基准上的实验表明,CRL-VLA 有效调和了这些相互冲突的目标,在抗遗忘与前向适应两方面均优于基线。
