论文

VLA-ZO:视觉-语言-动作模型的快速零阶适应

VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models

模型训练参数高效训练

摘要

使视觉-语言-动作 (VLA) 模型适应部署时间分布变化对于可靠的机器人操作非常重要,但传统的一阶自适应可能会超出面向推理的部署平台的记忆预算。零阶 (ZO) 优化提供了推理级记忆的仅前向替代方案,但准确的梯度估计需要许多扰动查询,这使得朴素 ZO 对于大型VLA模型来说速度极其缓慢。我们提出了VLA-ZO,一种利用VLA计算结构的快速 ZO 适应框架。通过将适应限制在动作方面,VLA-ZO 冻结了昂贵的视觉语言前缀,并在扰动查询和优化器步骤中重用其条件状态,而调度感知预取则隐藏了状态传输开销。在 LIBERO 相机视点变化上,相对于基线 ZO,VLA-ZO 将端到端适应时间在 $q=16$ 处减少了 25.59$\times$,在 $q=64$ 处减少了 32.54$\times$,同时将平均任务成功率从没有适应的 48.27% 分别提高到 58.17% 和 63.58%。这些结果表明,使 ZO 更快可以使更大的查询预算切实可行,从而为部署平台上资源高效的VLA适应提供了一条有希望的途径。

VLA-ZO:视觉-语言-动作模型的快速零阶适应的原论文方法或结果图
图 3:VLA-ZO 概述。