论文

减少时间冗余以实现高效的视觉-语言-动作推理

Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型对机器人操作表现出很强的通用性,但其高推理延迟限制了实时部署。我们确定了现有 VLA 管道中时间冗余的两个主要来源:高度相似的连续帧的重复视觉编码和基于扩散的策略中的多步迭代采样。为了解决这个问题,我们提出了一种系统级加速策略,可以减少感知和动作生成中的计算。在感知方面,我们仅增量更新与动态场景区域相对应的标记,而不是重新编码整个帧。在政策方面,我们通过面向效率的训练将扩散采样压缩为紧凑的两步计划,同时保持动作精度。在 Libero、RobotWin 和 Real Robot 平台上进行的实验表明,在保持高性能的同时,加速速度提高了 2 倍以上,在一般操作基准上实现了高达 98% 的成功率。我们的代码将在Github上发布。