论文
FoldQuantVLA:通过一致折叠对视觉-语言-动作模型进行本机低位量化
FoldQuantVLA: Native Low-Bit Quantization of Vision-Language-Action Models via Consistent Folding
摘要
低位视觉语言动作推理必须减少观察到动作的延迟,同时保留机器人的行为。我们提出了 FoldQuantVLA,这是一种训练后量化框架,它通过校准、权重舍入和本机整数执行来实现一致的激活表示。它将通道缩放和块 Hadamard 变换与动态每词元量化相结合,无需策略重新训练。自定义 TensorRT 插件在 Ada GPU 和 Jetson AGX Orin 上使用四位权重和激活 (W4A4) 在语言主干和迭代动作专家中执行投影。评估涵盖 LIBERO、SimplerEnv 和两个机器人平台。在三个 GR00T 检查点和 $\pi_{0.5}$ 中,W4A4 在 Orin 上比浮点 TensorRT 实现了 $1.20$ 到 $1.33\times$ 加速,在桌面上实现了 $1.25$ 到 $1.52\times$ 加速。将语言注意力输出和前馈向下投影保留在八位(W8A8)可以提高所有四个检查点上的保留动作保真度。在四项真实机器人任务中,这种配置将观察到的 GR00T N1.7 成功率从统一 W4A4 的 80.0\%$ 提高到每种配置 80 次试验的 92.5\%$,并且测得的额外 Orin 延迟为 1 毫秒。