论文
OrthoSkillVLA:通过梯度通知技能子空间适应进行持续技能学习
OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation
摘要
预训练的视觉-语言-动作模型为机器人学习提供了坚实的基础,但顺序地使它们适应不同的技能可能会扰乱先前技能使用的表示和速度映射,从而导致灾难性的遗忘。基于架构的方法通过隔离技能来提高保留率,但会导致推理足迹增加。最近的子空间约束方法限制正交子空间中的参数更新以最小化干扰,但对整个模型施加统一的约束。我们分析了内部 VLA 组件的不同作用,并确定了两个 VLA 特定的挑战。首先,VLM 维护广泛的语义表示,使其容易受到容量耗尽的影响,而 ActionHead 将语义细化为对扰动高度敏感的局部速度模式。其次,最终的速度解码器用作读出层。冻结它会形成输出阶段的表现力瓶颈,而更新它则可能会覆盖以前的速度映射。为此,我们提出了 OrthoSkillVLA,这是一种参数高效的框架,用于在预训练的 VLA 模型中持续学习技能,而无需演示重放。考虑到表示异构性,我们对 VLM 和 ActionHead 施加单独的子空间约束,保留可重用的语义容量,同时保护局部速度模式。对于输出层,我们引入了一个轻量级的特征感知 MoE 解码器,其中每个技能都分配了一个紧凑的专家,并且 无需训练 路由器根据特征空间亲和力选择专家。广泛的模拟和现实世界评估以及消融表明,OrthoSkillVLA 在获得新技能的同时可以更好地保留先前技能。