论文

$M^2$-VLA:通过层混合和元技能增强视觉语言模型以进行通用操作

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

摘要

当前的视觉-语言-动作 (VLA) 模型主要依赖于端到端 微调。虽然有效,但这种范式损害了视觉语言模型(VLM)固有的泛化能力,并导致灾难性的遗忘。为了解决这些限制,我们提出 $M^2$-VLA,这表明广义 VLM 能够直接作为机器人操作的强大支柱。然而,弥合 VLM 的高级语义理解与机器人控制的精确要求之间的差距仍然是一个关键挑战。为了克服这个问题,我们引入了混合层(MoL)策略,该策略可以从密集的语义特征中选择性地提取任务关键信息。此外,为了促进模型容量受限下的高效轨迹学习,我们提出了一个集成强归纳偏差的元技能模块(MSM)。在模拟和现实环境中进行的大量实验证明了我们方法的有效性。此外,泛化和消融研究验证了该架构的零样本能力,并确认了每个关键组件的贡献。我们的代码和预训练模型将公开。