论文

CRL-VLA:持续视觉-语言-动作学习

CRL-VLA: Continual Vision-Language-Action Learning

模型训练持续学习

摘要

终身学习对开放世界环境中的具身智能体至关重要,强化学习微调已成为一种重要范式,使视觉-语言-动作(VLA)模型能够通过环境交互掌握灵巧操作。因此,持续强化学习(CRL)是在终身机器人场景中部署 VLA 模型的一条有前景的路径,然而对现有方法而言,在稳定性(保留旧技能)与可塑性(学习新技能)之间取得平衡仍是一项艰巨挑战。我们提出 CRL-VLA,一个具有严格理论界限的 VLA 模型持续后训练框架。我们推导出一个统一的性能界,将稳定性-可塑性权衡与目标条件优势幅值联系起来,并以策略散度加以缩放。CRL-VLA 通过非对称调节化解这一两难:约束先前任务上的优势幅值,同时允许新任务上的优势受控增长。这通过一个简单而有效的双评估器架构与新颖的目标条件价值形式化(GCVF)实现:冻结的评估器锚定语义一致性,可训练的估计器驱动适应。在 LIBERO 基准上的实验表明,CRL-VLA 有效调和了这些相互冲突的目标,在抗遗忘与前向适应两方面均优于基线。

CRL-VLA:持续视觉-语言-动作学习
图1:我们提出的 CRL-VLA 方法。CRL-VLA 是一个面向 VLA 模型的持续学习框架,它将目标条件下的优势幅度视为决定稳定性与可塑性之间权衡的关键因素。CRL-VLA 通过双 critic 架构和带若干正则化项的 PPO 损失来实现这一思想,支持非对称调节,能在保留先前知识的同时高效适应新任务。