论文
VLA-GSE:通过通用和专业专家提升 VLA 中的参数效率 微调
VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts
摘要
视觉语言动作(VLA)模型继承了预先训练的视觉语言主干的丰富视觉语义先验,但使它们适应机器人控制仍然具有挑战性。完整的 微调 (FFT) 很容易过度拟合下游机器人数据,并灾难性地忘记预先训练的视觉语言功能。参数高效的 微调 (PEFT) 更好地保留了预先训练的知识,但现有的 PEFT 方法仍然难以有效地适应机器人控制任务。为了解决这一差距,我们提出了 VLA-GSE,这是一种参数高效的 VLA 微调 框架,可以改进控制自适应,同时保留 PEFT 的知识保存优势。具体来说,VLA-GSE(广义和专业专家)通过对冻结主干进行频谱分解,将领先的奇异分量分配给广义专家(共享专家)并将不相交的剩余分量分配给专业专家(路由专家)来初始化。这种分解提高了固定可训练参数预算下的适应能力。在可比较的参数预算下,VLA-GSE 仅更新完整模型参数的 2.51%,并且始终优于强大的 FFT 和 PEFT 基线。它在 LIBERO-Plus 上实现了 81.2% 的平均零样本成功率,在多模态理解基准上保留了与 LoRA 相当的预训练 VLM 能力,并提高了多个分布变化下的实际操作成功率。代码位于:https://github.com/YuhuaJiang2002/VLA-GSE