论文
AdaVLA:视觉-语言-动作模型 无需训练 加速的自适应步骤流匹配
AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models
摘要
基于视觉语言模型 (VLM) 构建的视觉语言动作 (VLA) 模型通过利用互联网规模的知识和多模态推理,显着增强了机器人能力。然而,VLA 的密集计算开销限制了设备上的部署,阻碍了对环境变化的实时响应。虽然已经提出了各种加速技术,但它们通常依赖于 微调 或对训练数据集的访问,而由于隐私和专有问题,这些数据集经常不可用。此外,尽管基于流匹配的 VLA 已成为标准扩散模型的有效替代方案,但当前的加速工作主要针对 VLM 推理成本,未能解决流匹配推理中固有的迭代 ODE 求解过程。为了解决这些限制,我们提出了 AdaVLA,这是一种在线 无需训练 自适应框架,用于快速而准确的基于流程匹配的视觉-语言-动作模型。我们引入了一种从流匹配轨迹曲率导出的新颖度量,以量化推理过程中动作生成的置信度。该指标可以通过有效计算的重要性评估来动态减少推理步骤并自适应调整 MLP 剪枝率,而无需访问训练数据。使用 Jetson AGX Orin 设备在 LIBERO 基准上进行的实验结果表明,我们的方法对于 $π_{0.5}$ 和 X-VLA 分别实现了 $1.87\times$ 和 $2.24\times$ 加速,而成功率的下降可以忽略不计。此外,我们使用 SmolVLA 验证了我们的方法在现实世界机器人任务中的稳健性。