论文

CHASE-VLA:动作块感知的VLA后训练量化

CHASE-VLA: Post-Training Quantization Framework for Vision-Language-Action Models with Chunk-Aware Scale Estimation

摘要

视觉-语言-动作(VLA)模型把视觉观测与语言指令映射为连续机器人动作,但基于扩散的动作专家(AE)给低比特后训练量化(PTQ)带来关键挑战:AE在去噪步与策略查询间被反复调用,固定校准尺度可能与随去噪进度与预期动作变化的激活范围失配。我们提出动作块感知的PTQ方法CHASE-VLA,利用策略现成可得的VLA特异信号——生成的动作块及其未执行的未来后缀:不止依赖AE层的静态尺度匹配,CHASE-VLA把先前生成的动作块作为因果动作上下文,结合去噪步组信息自适应AE激活尺度。这使重复AE中的MLP与注意力投影都可在不改动预训练策略的情况下W4A4量化。LIBERO上,π0.5的AE两层均W4A4量化后平均成功率97.3%,恢复FP16级性能;量化AE线性层权重存储减少73.4%,π0.5与GR00T N1.6的单块内存流量分别减少70.9%与71.2%,预测器开销至多为所省存储的1.26%。