论文
ActionCache:无需训练 通过动作缓存和细化实现视觉-语言-动作模型加速
ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
摘要
视觉-语言-动作(VLA)模型已成为一种有前途的通用机器人操作方法。特别是,基于流匹配的 VLA 模型由于能够生成精确且平滑的动作序列并捕获多模态分布而取得了显着的成功。然而,动作头中的迭代去噪过程是主要的计算瓶颈,对实时部署提出了严峻的挑战。为了应对这一挑战,我们提出了 ActionCache,这是一种即插即用的外部缓存,它可以机会性地重用过去的中间操作,以从目标操作附近热启动生成,从而大大减少推理延迟。具体来说,ActionCache 使用紧凑的多模式键存储中间操作,这使得可以从不同情节甚至不同任务的类似过去上下文中进行检索。模拟和现实环境中的实验结果表明,ActionCache 在低延迟状态下保持了较高的任务成功率,对于代表性的基于流的 VLA、$π_{0.5}$ 和 GR00T-N1.6 分别实现了高达 $10.44\times$ 和 $40.17\times$ 的操作头推理加速。