论文

CLAP:通过语言—动作对应直接进行 VLM 到 VLA 的适应

CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding

模型训练监督微调与指令调优

摘要

视觉语言动作模型 (VLA) 继承了预训练 VLM 的语义功能,但机器人数据和架构修改的大规模 后训练 可以广泛地重塑主干,以至于很难隔离 VLM 对控制的贡献。通过最少的架构更改将预训练的 VLM 直接转换为 VLA,为了解 VLM 功能如何跨模型规模转移提供了更透明的途径。核心障碍是输出分布不匹配:预测动作作为裸数字标记序列会使生成远离 VLM 的预训练语言分布,从而降低我们寻求保留的能力。为了解决这个问题,我们提出了 CLAP(因果语言动作预测),它在每个数字动作序列前面加上自然语言动作描述,在语言动作计划上因果调节精确的动作标记预测,而无需修改主干架构。单独使用单周期 微调,2B CLAP 在 LIBERO 上实现了 90.8%(比 VLA-0 多了 14.9 分),并提高了 LIBERO-PRO 在语言、对象和空间扰动下的鲁棒性。我们将发布 0.8B、2B 和 4B 的 CLAP,作为来自单一 VLM 谱系的开放权重、多尺度紧凑型 VLA 系列,从而实现 VLM 到 VLA 能力传输的受控分析。