论文
DA-PTQ:用于高效视觉-语言-动作模型的漂移感知 后训练 量化
DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models
摘要
视觉-语言-动作模型(VLA)已经展示了嵌入式人工智能的强大潜力,但由于高内存和计算需求,它们在资源有限的机器人上的部署仍然具有挑战性。虽然 后训练 量化 (PTQ) 提供了一种有效的解决方案,但直接将 PTQ 应用于 VLA 通常会导致顺序控制期间性能严重下降。我们认为时间误差累积是一个关键因素,其中视觉-语言-动作接口处的量化扰动逐渐放大,导致执行轨迹中的运动学漂移。为了解决这个问题,我们提出了漂移感知 后训练 量化(DA-PTQ),它将量化表述为顺序决策过程中的漂移感知优化问题。 DA-PTQ 由两个组成部分组成:(1) 跨空间表示补偿,可减轻多模态表示和动作空间之间的结构化失真,以提高动作一致性;(2) 运动驱动混合精度分配,通过最小化轨迹级运动误差来分配位宽。大量实验表明,DA-PTQ 显着减少了运动漂移,并在低位设置下实现了与全精度模型相当的性能,从而能够在资源有限的机器人平台上实际部署 VLA。