论文

UAM:VLA 训练中遗忘的双流视角

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

模型架构新型架构

摘要

视觉-语言-动作 (VLA) 模型通常由 微调 基于动作数据的预训练视觉-语言模型 (VLM) 构建。然而,我们表明这个标准配方系统地削弱了 VLM 的多模式能力,我们将这种副作用称为体现税。但 VLA 必须忘记吗?受生物视觉双流组织的启发,我们将这种退化追溯到结构瓶颈:当前的 VLA 要求单个编码器支持基于语言的语义和与控制相关的视觉特征,而生物视觉将识别和视觉运动控制分成不同的路径。基于这个观点,我们提出了统一行动模型(UAM),它添加了一个并行的背侧专家,模拟大脑的背侧通路。为了使 Dorsal Expert 成为有效的第二条途径并减少 VLM 的控制学习负担,我们从预训练的生成模型中初始化它,并使用预测视觉动态的中级推理目标对其进行训练。这种设计使我们能够仅在动作数据上端到端地训练整个 VLA:在没有参数冻结、没有梯度停止、没有辅助 VL 协同训练的情况下,UAM 保留了超过 95%$ 的底层 VLM 多模态能力,同时在探测分布外泛化的各种操作任务(包括不可见的物体、新颖的物体-目标组合和指令变化)上实现了基线中最高的平均成功率。总之,这些结果表明,VLA 中的语义保留可以从架构分离本身中产生,而不是通过冻结权重或辅助数据重放来强制执行,并且这种保留的语义功能可以自然地从 VLM 转移到动作中的语义泛化。