论文
LatentQuant:在 NVFP4 VAE 量化中保留面向策略的潜变量契约
LatentQuant: Preserving the Policy-Facing Latent Contract under NVFP4 VAE Quantization
摘要
近期世界动作模型(WAM)复用预训练视频 VAE,其编码器潜变量直接作为下游动作策略的条件。因此量化不仅要保留重建保真度,还要保留冻结策略所要求的潜变量契约。直接采用 NVFP4 会留下未补偿的 W4A4 量化误差;联合量化感知训练(QAT)虽然能恢复重建,却可能改变潜表示。在 Wan2.1 上,联合 QAT 的 VBench-7 几乎达到 FP32 水平,分别为 0.7403 与 0.7409,但 LIBERO 成功率从 95.5% 跌至 10.5%。只针对解码器的受控实验显示,激活量化与反量化会改变重建信号及解码器雅可比矩阵,进而改变返回编码器的梯度方向,造成持续的潜变量漂移。基于这一机制,我们提出两阶段 NVFP4 QAT 框架 LatentQuant:先将量化编码器与高精度编码器对齐,再冻结编码器并适配解码器。在 Wan2.1 与 Wan2.2 上,LatentQuant 保持接近基线的控制能力和高重建质量,LIBERO 成功率达 95.75%,RoboTwin 达 68.8%。在 NVIDIA B300 GPU 上,相比 BF16 cuDNN,NVFP4 实现 1.17—1.26 倍的端到端 VAE 加速。
