并非所有层都需要调整:诊断和指导视觉-语言-动作模型中的适应
Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models
摘要
为新的部署环境微调视觉-语言-动作(VLA)模型的成本很高,但大多数方法将统一容量适配器应用于每个网络区域,就好像每个区域都需要进行同等调整一样。本文在五个架构不同的 VLA(OpenVLA-OFT、$π_0$、SmolVLA、DTP、Octo;93M-7B 参数)上测试了这一假设。将每个区域的适应成本测量为区域隔离微调下的归一化参数位移,揭示了一个适应谱,其中外观变化将成本集中在视觉编码器中,指令变化集中在语言主干中,以及新颖对象变化集中在视觉编码器和动作头中,跨越所有五种架构。为了利用这种结构,我们引入了一个观察、诊断、分配和适应的管道。根据十个未标记的目标观察结果,并且无需进行微调,诊断通过将无参考梯度和蒙特卡罗辍学信号与针对缓存源参考的中心核对齐分数相结合来估计每个区域的成本;分配器将估计值转换为参数预算下的可变等级 LoRA 适配器,并冻结经过良好校准的区域;标准 LoRA 微调训练生成的适配器。该诊断以 Spearman 中值 0.91 对每个部署中的区域进行排名,并且在我们在 LIBERO 和 CALVIN 上测试的每个预算中,分配与统一的 LoRA 相匹配或超过。在物理 xArm-7 上,该管道在指令措辞转变下与可训练参数的 0.04% 进行完全微调相匹配,并且在没有重新训练的情况下评估的 5 个保留场景中,它领先于每个基线,30 次部署的成功率为 11-23,而在相同或更大的预算下,最强参数有效基线的成功率为 8-18,完全微调的成功率为 2-11。这些结果表明,VLA 中的适应成本结构足以在微调开始之前进行测量。