论文

使用离线隐藏状态蒸馏恢复积极修剪的视觉语言动作模型

Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation

摘要

视觉-语言-动作(VLA)模型让机器人遵循语言指令,但其数十亿参数的语言主干是在机器人硬件上运行它们的主要障碍。结构化修剪减少了主干,从 OpenVLA-OFT 中删除 63% 的主干,使 LIBERO-Long 的成功率从 93.2% 下降到 0.8%。最近的一种方法通过监督微调和强化学习来恢复这样的模型,这需要在线部署和数百个 GPU 小时。我们完全在线下恢复了大部分失去的成功。宽度修剪缩小了块,但保持残差流保持其原始大小,因此教师和学生隐藏状态具有相同的形状并直接匹配,无需投影仪。针对教师通道中内置的缓存进行训练,可在大约 8 个 GPU 小时内将学生的分数降低 63%,与教师的差距缩小到 3.5 分之内。通过对九个比率的扫描,可以确定恢复目标开始发挥作用的地方。最多减少 45%,两者在 OpenVLA-OFT 上没有显着差异。然后,隐藏状态蒸馏在 63% 到 87% 之间增加 +2.1 到 +4.5 点,并从 63% 开始在 CogACT 上增加 +9.4 到 +22.1 点。 CogACT 上的恢复预算为 81%,三倍的恢复预算将精炼学生与老师的平均差距缩小到 3.9 分,而监督恢复仍比老师低 20 多分。在匹配压缩时,宽度修剪会产生更高的成功率,深度修剪会降低延迟。在 6-DoF 机械臂上,精炼学生在减少 72% 的情况下达到了 77.5% 的成功率,而监督恢复的成功率为 59.5%,机上运行速度比教师快 2.23 倍,并且使用的内存减少了 62%。