论文

SteerQuant:在世界动作模型中通过动作引导缩放来控制量化误差

SteerQuant: Steering Quantization Error with Action-Guided Scaling in World-Action Models

摘要

世界动作模型 (WAM) 通过迭代去噪联合生成未来世界状态和动作,使用共享权重处理视频、本体感受和动作标记的异构语义流。量化降低了推理成本,但不同流中的可比数值误差可能对最终动作产生明显不同的影响,使得仅数值精度不足以实现可靠控制。我们引入了 SteerQuant,这是一种用于 WAM 的 4 位量化框架,可将错误引导至对最终操作影响较小的计算中。它映射每个流的量化误差如何影响最终操作,并使用该映射来指导共享通道缩放。针对每个流和去噪步骤进一步校准激活缩放,以适应激活范围和动作影响的变化。这可以使量化适应不同的流要求,而无需重复权重或增加所选流的位宽。为了减少因扩展而引入的额外内核启动和内存流量,我们开发了 Rudder,这是一种用于 WAM 的 4 位推理引擎,它将扩展和输出补偿融合到低位内核中。在 W4A8 和 W4A4 下,SteerQuant 将 LIBERO 的平均成功率保持在全精度 0.8 个百分点以内,同时在三个 WAM 上提供比 BF16 高达 2.23倍的降噪加速,同时降低峰值 GPU 内存使用量。在真正的双臂机器人上,W4A8 部署实现了 1.35倍 的端到端推理加速,同时保持相对于 BF16 的平均任务成功率。