论文
微调视觉-语言-动作模型所需的层数比您想象的要少
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
摘要
在海量视频机器人数据集上预训练的视觉-语言-动作 (VLA) 模型彻底改变了机器人操作,但其数十亿参数架构在下游 微调 和实时推理过程中带来了令人望而却步的计算负担。在这项工作中,我们揭示了这些连续控制基础策略(例如 pi_0、GR00T-N1.5)的一个非常重要的架构特征:尽管接受了不同物理轨迹的训练,但它们表现出严重的分层表示冗余。为了利用这一点,我们引入了一个完全是 无需训练 的结构压缩管道,绕过了现有方法加载全尺寸模型来学习优化的词元缩减或动态层选择器的需要。相反,我们仅使用通过中心内核对齐的单个前向传递来识别冗余层特征,并删除了双层,以在 VLM 主干和连续控制策略头中将模型深度永久压缩高达 50%。这种简化架构的下游 微调 具有双重加速优势:训练时间减少 40-50%,实时推理速度提高 30%,同时匹配或超过全面的基础模型性能。我们在三个模拟基准(LIBERO、RoboCasa、SimplerEnv)和 4 个独特的机器人实施例中的 10 个不同的现实世界操作任务中全面验证了我们的方法。这些结果证明,先进的 VLA 所需的层数比之前假设的要少得多,为可扩展的机器人学习提供了高计算效率的范例。