论文
rMuscle:用于高效视觉-语言-动作模型推理的机器人肌肉记忆
rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
摘要
工厂工作是体现人工智能的一个有前景的早期场景:将重复性的体力工作分配给机器人可以带来明显的经济回报,而结构化的工作站可以使这些工作易于适应当前的政策。视觉-语言-动作(VLA)模型现在作为这些机器人的政策范式占据主导地位。 VLA模型的推理延迟直接影响机器人的响应能力和运动平滑度。然而,现有的 VLA 推理框架没有充分利用具体工作负载的特征,也没有考虑到 VLA 推理不同阶段的明显瓶颈。在本文中,我们首先描述了具体工作负载的特征,并确定了机器人重复执行过程中的实质性任务相似性。我们进一步发现这种相似性超出了观察和动作轨迹,延伸到了内部模型状态。根据这些观察结果,我们提出了 rMuscle,这是一种受人类肌肉记忆启发的实时 VLA 推理框架。它通过双相肌肉内存缓存利用交叉执行相似性。上下文缓存重用视觉词元输出来减少计算,而动作缓存重用神经元激活模式来减少权重访问。我们通过在线缓存重新计算、滑动窗口缓存检索和连续去噪步骤之间的掩码共享来保持缓存内存占用和访问开销较低。 rMuscle 在 RTX 4090 和 Jetson Thor 上的 LIBERO、RoboTwin 和物理操作任务上实现了 1.29-1.42 倍的加速,同时保持了现实世界机器人的原始成功率。