论文

编码器获胜者不能可靠地跨 VLA 主干网转移:冻结主干网移植诊断

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

模型评测评测方法与指标

摘要

视觉-语言-动作 (VLA) 策略通常从上游 VLM 版本继承其视觉编码器,但尚不清楚在小型 VLA 上验证的编码器选择是否会转移到更大的骨干网。我们引入了冻结骨干移植诊断:已发布的 VLA 的视觉塔被固定协议(自适应平均池、LayerNorm 和单个可训练线性投影仪)下的候选编码器取代,语言模型和动作专家被冻结。在四个编码器、两个 LIBERO 套件、两个主干(SmolVLA-450M 和 $π_{0.5}$-3.3B)以及每个单元两到三个种子(40 个主要嫁接运行加上原生、LoRA、池化和零/洗牌图像控制,所有这些均通过离线操作 MSE 进行评分)中,小主干获胜者不能可靠地选择大主干顶层:SigLIP 是最好的SmolVLA 跨越两个套件,而在 $π_{0.5}$ DINOv2-small 上领先于空间套件,而对象套件是种子敏感的近联系带;四个骨干套件比较中的三个(以及 12 个种子级单元中的 11 个)支持骨干依赖性排名。嫁接包装本身是非中性的,在主干上具有相反的符号(SmolVLA 原生塔上为 +45-56% MSE,$π_{0.5}$ 上为 -50-52%),因此所有结论都以固定嫁接协议为条件。我们将冷冻嫁接定位为一种廉价的目标主干诊断,在大规模投入编码器之前运行,而不是作为闭环部署声明。