论文

QuantWAMs:为世界动作模型选择正确的校准粒度

QuantWAMs: Calibrating at the Right Granularity for World Action Models

摘要

世界动作模型(WAM)联合预测未来观测与动作,但其迭代去噪与闭环执行使高效部署成本高昂。现有训练后量化(PTQ)方法不太适合 WAM,因为它们依赖开环目标、同质的模型假设以及不反映部署实况的校准分布。我们提出 QuantWAMs,一个将量化决策与由模型结构、rollout 分布和任务目标共同定义的校准上下文对齐的 PTQ 框架。QuantWAMs 引入三种策略:共享基异常值校准,只在坐标兼容的模块间汇集激活证据;协同训练目标显著性,从视频—动作联合梯度计算经验 Fisher 分数,并在校准稳定的层粒度上分配权重精度;固定干预 rollout 审计,在不改变精度预算的前提下,利用可达的闭环状态修订去噪步保护调度。我们在 Fast-WAM 和 LingBot-VA 上,结合 RoboTwin 2.0、LIBERO 以及使用 AgiBot G2 的真机操作对 QuantWAMs 进行评估。在以 W4A4 为主的设置下,报告的仿真均值与 FP16 相差 0.2–0.7 个百分点。真机试验进一步验证了在三个操作任务上的部署可行性。对目标视频与动作模块,QuantWAMs 将峰值权重与激活内存降至 FP16 的约 29%,并提供 1.4–1.6 倍的模块级加速。

QuantWAMs:为世界动作模型选择正确的校准粒度:论文配图
图 1:self_attn.o 上的异常值演变。 (a) 原始激活显示持续的每通道异常值。 (b) 联合平滑 + Hadamard 旋转分散通道间的幅度。 (c) 低 N 样本噪声下的每个上下文 Top-K 会产生不稳定的掩模和较低的恢复能量。 (d) QuantWAM 保留 FP16 中的汇集能量 Top-KK 通道,并将其他通道量化为 A4。