论文
面向 Vision-Language-Action 模型的环境感知自适应剪枝与交错推理编排
Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models
摘要
Vision-Language-Action(VLA)模型在具身智能中前景可观,但其庞大参数量带来显著推理时延,妨碍实时操作,促使参数稀疏化研究。然而,随着环境在 VLA 执行过程中演化,最优稀疏模式也随之改变。静态剪枝缺乏应对环境动态所需的自适应性,而固定间隔的动态层剪枝存在粒度粗、重训练开销高的问题。为弥合这一鸿沟,我们提出 EcoVLA,一个免训练、即插即用的自适应剪枝框架,可与现有 VLA 加速方法正交组合。EcoVLA 包含两个组件:环境感知自适应剪枝(EAP)与交错推理编排(I²O)。EAP 是一种轻量的自适应通道剪枝方法,利用物理环境的时间一致性来更新稀疏模式。I²O 利用 VLA 推理中固有的 FLOPs 气泡来并行调度剪枝方法,确保对时延影响可忽略。在多样 VLA 模型与基准上的评估显示,EcoVLA 达到最先进性能,实现最高1.60×加速且成功率仅下降0.4%;与 token 剪枝组合后进一步达到2.18×加速且仅0.5%的性能下降。我们还在真实机器人上验证了 EcoVLA 的有效性。
