论文

Mix-QVLA:视觉-语言-动作模型的任务证据感知混合精度量化

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

摘要

我们提出了 Mix-QVLA,一种用于 VLA 模型的任务证据感知混合精度 PTQ 框架。 Mix-QVLA 将每个量化变体锚定到全精度动作词元参考决策,并评估量化是否跨关键 VLA 功能边界保留与任务相关的证据。它根据边界激活计算归一化梯度加权任务证据图,并使用证据质量和归因分布失真比较全精度和量化图,捕获决策支持证据的强度和分配的变化。软瓶颈目标将边界级退化聚合为逐层敏感性得分。 Mix-QVLA 进一步对整个任务执行过程中的灵敏度进行建模,捕获层重要性的阶段相关变化,而不是假设固定的灵敏度配置文件。由此产生的证据和时间感知分数指导模型大小和 BitOps 预算下的混合精度位分配。对 OpenVLA 式策略的广泛评估表明,Mix-QVLA 改善了低位 VLA 部署的准确性与效率权衡。在 LIBERO 上,Mix-QVLA 将 OpenVLA-OFT 内存从 15.4 GB 减少到 4.1 GB,与 BF16 模型的 97.1 相比,保留了 96.3 的平均成功率,并实现了 1.52 倍的推理加速。