论文
PriorVLA:视觉-语言-动作模型的先验保留适应
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
摘要
大规模预训练使视觉-语言-动作(VLA)模型有望为通用机器人操作奠定基础,但仍需要使其适应下游任务。然而,完整 微调 的常见做法将预训练视为初始化,并且可以将广泛的先验转向狭窄的训练分布模式。我们提出了 PriorVLA,这是一种新颖的框架,可以保留预先训练的先验知识并学习利用它们进行有效的适应。 PriorVLA 将冻结的先验专家保留为只读先验来源,并为下游专业化训练适应专家。专家查询从预训练的 VLM 中捕获场景先验,从先验专家中捕获运动先验,将两者集成到适应专家中以指导适应。总之,PriorVLA 仅更新完整 微调 更新的参数的 25%。在 RoboTwin 2.0、LIBERO 和实际任务中,PriorVLA 实现了比完整 微调 和最先进的 VLA 基线更强的整体性能,在分布外 (OOD) 和少样本设置下收益最大。 PriorVLA 在 RoboTwin 2.0-Hard 上比 pi0.5 提高了 11 个点,并在 LIBERO 上实现了 99.1% 的平均成功率。在八个实际任务和两个实施例中,PriorVLA 使用标准数据达到了 81% 的分布内 (ID) 成功率和 57% 的 OOD 成功率。每个任务仅进行 10 次演示,PriorVLA 就达到了 48% ID 和 32% OOD 成功率,分别超过 pi0.5 24 和 22 个百分点。