论文
HoloQ-VLA:视觉-语言-动作模型的统一 W4A4 量化
HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型将感知、推理和控制统一在一个策略中,但其数十亿参数的主干和基于扩散的动作头使得设备上的部署成本极其昂贵。低位 后训练 量化 (PTQ) 是自然的补救措施,但发出连续控制信号的扩散作用头对此高度敏感:一些权重和激活异常值足以使头不稳定,因此之前的工作使其保持全精度或退回到混合精度方案,并且将整个模型统一量化为低位宽仍然是一个开放的挑战。我们提出了 HoloQ-VLA,这是第一个 无需训练 PTQ 框架,它将语言主干和整个扩散动作头压缩到统一的 W4A4 精度,而无需混合精度分配。 HoloQ-VLA 不是权重质量与激活质量之间的权衡,而是通过互补变换针对两个离群值源:由激活分散哈达玛变换组成的权重自适应旋转,以及吸收动作头在去噪步骤中表现出的动态范围漂移的每步缩放。在 LIBERO 上,HoloQ-VLA 将 Pi-0.5 和 GR00T-N1.5 压缩为 W4A4,任务成功率分别为 98.0% 和 87.8%,匹配或超过 FP16 参考的 97.1% 和 87.0%,同时将静态内存占用量减少了 74.2%。现实世界的操纵实验进一步证明HoloQ-VLA在不同的现实世界场景中保持平滑和准确的控制。