论文

VLAQuantBench:视觉-语言-动作模型训练后量化的闭环评估

VLAQuantBench: Closed-Loop Evaluation of Post-Training Quantization for Vision-Language-Action Models

智能体系统Agent任务评测

摘要

训练后量化降低了视觉语言动作 (VLA) 模型的内存要求,但精度选择必须考虑层范围、数值格式和校准之间的相互作用。我们引入了 \textbf{VLAQuantBench},这是一种受控评估,包含 409 次运行和 94,574 次模拟:LIBERO 上的四个模型,X-VLA 在三个模拟基准系列上进行了额外评估。在未校准的 W4A4 舍入到最近量化下,将 $\pi_{0.5}$ 动作头子集从 126 层扩展到 167 层,成功率从 7.0\% 提高到 70.5\%。固定观察重放证实了相应的数值恢复。两集校准消除了测试子集中的严重联合故障,而相同的平滑和裁剪方法会降低 $\pi_0$ 成功率,并且不会端到端恢复 OpenVLA-OFT。对于 OpenVLA-OFT,保护一个 28,672 个参数的输出投影反而会恢复接近基线的成功:其余 441 个合格的线性层在所有四个套件中保留 LIBERO-Long 或 8 位激活上的 W3。任务集群间隔支持较大的故障和恢复对比。这些结果建立了依赖于配方的交互并确定具体的精度分配,而不是通用的层敏感性规则。真实内核和物理机器人测量补充了准确性分析。代码、配置和剧集记录可在此 https URL 上公开获取。