论文

ActQuant:视觉-语言-动作模型的亚 4 位动作引导量化

ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型表现出显着的体现智能动作生成能力,但其繁重的计算使得在边缘平台上的部署不切实际。激进的低于 4 位权重量化是自然的解决方案,但现有的 后训练 量化 (PTQ) 方法在这种情况下会遭受严重的性能下降。为了解决这个问题,我们引入了 ActQuant,一个动作引导的混合精度 PTQ 框架,它分两个阶段运行:(1)张量间位分配器,根据每个权重矩阵对预测智能体动作的贡献程度,为每个权重矩阵分配一个位宽; (2) 张量内尺度优化器使用动作感知曲率调整每块量化尺度,以便动态范围集中在对控制最有影响的权重上。为了提供积极量化的设备端优势,我们进一步引入了 OmniModel.cpp,这是一种代理转换管道,可将架构移植到具有高效低位内核的本机 C/C++ 运行时中。我们在模拟和现实世界的 6-DoF UR3 手臂上评估 ActQuant,所有模型均通过 OmniModel.cpp 部署。在 LIBERO 基准上,ActQuant 是唯一一种以每权重 3 位或以下的速度运行的方法,在 OpenVLA-OFT 上保留了 95.0%,在 $π_{0.5}$ 上保留了 94.8%。进一步推进,ActQuant 在 OpenVLA-OFT 上达到 2.5 bpw,压缩率为 90.1%,将骨干网从 14.3 GB 压缩到 2.7 GB(5.3$\times$)。在物理 UR3 手臂上,使用 ActQuant 量化的 $π_{0.5}$ 保留了基线的成功率,同时将内存占用量减少了 2.5$\times$。