论文

面向高效VLA推理的质心复用运动感知向量量化框架

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

摘要

视觉—语言—动作(Vision-Language-Action, VLA)模型已在具身智能上展现出强大潜力,但其在GPU上的高推理延迟限制了实时部署。以Dadu-Corki为代表的现有加速器提升了效率,但将VLA模型当作全精度负载处理,使内存与计算中的大量冗余未被利用。本文提出VQVLA,一个算法—硬件协同设计框架,通过利用权重相似性与执行动态来加速VLA推理。我们首先提出MotionVQ,一种运动感知的向量量化方案,根据机器人执行状态动态调整量化精度,在保持任务成功率的同时减少内存访问。随后提出合并质心的向量化GEMM范式,在码本索引表示上运算,通过质心的空间聚合与时间复用消除冗余乘法。为实现这些优化,我们设计了一个高效支持动态精度选择与质心复用计算的加速器。实验结果显示,VQVLA分别相对A100 GPU、Dadu-Corki、LUT-DLA、CodeGEMM和ShiftAddLLM取得6.5倍、2.8倍、1.9倍、3.3倍和4.3倍加速,而精度退化可忽略。

面向高效VLA推理的质心复用运动感知向量量化框架:论文配图
图 1.VQVLA(硬件和软件协同设计框架)概述。