论文

ElegantVLA:按控制阶段分配视觉、语言与动作计算

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

模型推理测试时计算扩展

摘要

视觉-语言-动作 (VLA) 模型是通用机器人控制的强大范例。然而,它们的高计算成本和有限的控制频率阻碍了实时机器人操作,特别是当大型视觉语言骨干和迭代动作头在每个控制步骤运行时。现有的 VLA 加速方法通常优化各个组件或依赖固定的加速规则,用很大程度上固定的计算来处理不同的控制步骤,并忽略序列化具身控制的非均匀推理需求。受人类运动控制的启发,认知和反馈资源集中在目标敏感阶段,我们认为 VLA 模型应该学习何时投入全部计算以及何时重用先前的计算。我们提出了 ElegantVLA,这是一种插件阶段自适应推理框架,可通过模型内动态计算调度来加速 VLA 模型。 ElegantVLA 引入了一个轻量级调度程序,可观察时间表示相似性、机器人运动线索和任务进度,以联合分配视觉编码器、LLM 和动作头的计算。对于感知语言推理,调度器基于视觉语言表示稳定性,选择五级 Vision-LLM 计算模式,从完全重新计算到跨多个步骤复用。对于动作生成,它选择三级去噪模式,在稳定运动期间重用中间去噪状态,同时保留目标敏感阶段的全面细化。通过协调这些决策,ElegantVLA 为具有显式动作生成模块的现代 VLA 管道提供了通用加速框架,而无需修改或重新训练基本模型。 GR00T 和 CogACT 的实验实现了高达 2.55 倍和 3.77 倍的加速,并且在六个现实 GR00T 任务中,ElegantVLA 将计算量减少了 2.18 倍,同时将控制频率从 13.8 Hz 提高到 26.3 Hz。