论文

面向 Vision-Language-Action 模型的环境感知自适应剪枝与交错推理编排

Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models

摘要

Vision-Language-Action(VLA)模型在具身智能中前景可观,但其庞大参数量带来显著推理时延,妨碍实时操作,促使参数稀疏化研究。然而,随着环境在 VLA 执行过程中演化,最优稀疏模式也随之改变。静态剪枝缺乏应对环境动态所需的自适应性,而固定间隔的动态层剪枝存在粒度粗、重训练开销高的问题。为弥合这一鸿沟,我们提出 EcoVLA,一个免训练、即插即用的自适应剪枝框架,可与现有 VLA 加速方法正交组合。EcoVLA 包含两个组件:环境感知自适应剪枝(EAP)与交错推理编排(I²O)。EAP 是一种轻量的自适应通道剪枝方法,利用物理环境的时间一致性来更新稀疏模式。I²O 利用 VLA 推理中固有的 FLOPs 气泡来并行调度剪枝方法,确保对时延影响可忽略。在多样 VLA 模型与基准上的评估显示,EcoVLA 达到最先进性能,实现最高1.60×加速且成功率仅下降0.4%;与 token 剪枝组合后进一步达到2.18×加速且仅0.5%的性能下降。我们还在真实机器人上验证了 EcoVLA 的有效性。

面向 Vision-Language-Action 模型的环境感知自适应剪枝与交错推理编排
图2:EcoVLA 总体流水线。(a) 环境感知自适应剪枝(Environment-aware Adaptive Pruning,EAP):EAP 是一种轻量级、环境感知的方法,通过感知实时动态来识别稀疏度变化。考虑到 VLA 在物理环境中执行的时间一致性,EAP 将瞬时特征与历史特征相结合,共同计算稀疏模式。(b) 交错推理编排(Interleaved Inference Orchestration,I²O):I²O 使用非阻塞并行范式,将稀疏模式计算交错嵌入 VLA 推理固有的 FLOPs 气泡中。