论文

是什么造就了高效的 VLA?导航操作头设计、扩展和延迟

What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency

模型优化小模型/轻量模型

摘要

视觉-语言-动作(VLA)模型结合了预训练的视觉编码器、语言骨干和动作头,但它们的相对贡献尚未在受控、延迟配对的条件下确定。我们修复了主干系列(SigLIP2 和 Qwen2.5)和训练管道,扫描了动作头设计和模块规模,并将每个配置与测量的设备上延迟配对。该研究得出三项发现。首先,动作头的性能主要由初始化决定,而不是解码器架构、损失或推理预算:将语言主干的最后一个转换器层复制到头部是最大的杠杆,没有延迟成本,也是在每个模块规模上都有帮助的唯一轴。对齐还解释了其他轴:流匹配和较重的解码器仅在头部未对齐且对齐后反转时才有效,并且额外的推理过程不会带来任何可衡量的好处;表现力似乎可以替代缺失的对齐。我们将其理解为表示迁移:对齐的头部继续关注指令的对象名词,并在权重空间中保持靠近主干,而不是重新学习从头开始行动。因为我们只能通过初始化来实现对齐,所以我们将其作为最好地组织测量的帐户,而不是已证明的原因,并命名将解决它的控件。其次,容量只有在对齐后才有价值:对齐的行动头是规模化回报率最高的模块。第三,这些回报在接近当今 $π$ 系列 VLA 已经使用的大小时急剧减少,因此进一步的增长对其延迟几乎无法带来域内精度。这些指定了 EffVLA,这是一个与标准 LIBERO 上最强的开源 VLA 相匹配的紧凑模型,以较低的延迟在大多数 LIBERO-Plus 扰动轴上领先,并在配方不变的情况下转移到真正的 SO-ARM101 手臂。