论文

超越分布内恢复:以脆弱性调优恢复量化 VLA 泛化

Beyond In-Distribution Preservation: Recovering Generalization in Quantized VLAs via Vulnerability-Oriented Tuning

摘要

后训练量化已被证明可以在标准评估条件下保留 VLA 性能,但它是否保留完整 精度 模型的鲁棒性和泛化性仍有待探索。在本研究中,我们系统地研究了后量化VLA 策略在环境干扰下的鲁棒性和泛化性。经验结果表明,尽管保持了相当的分布内性能,但量化的策略可能会因细微的环境变化而变得脆弱。我们进一步观察到,动作差异集中在 执行轨迹 状态的一小部分中,而 教师模型 指导根据差异具有相反的效果:它提高了高差异状态下的泛化能力,但会在低差异状态下降低泛化能力。这些发现表明,有效的量化后恢复需要有选择地干预脆弱状态,而不是全局提取 学生模型。因此,我们提出了策略-Induced Vulnerability-Oriented Tuning (PIVOT-Q),这是一种漏洞感知 On-策略 Distillation (OPD) 框架,它可以使用冻结的完整 精度策略作为 教师模型 来选择性地纠正量化 学生模型 执行轨迹 期间遇到的脆弱状态。 PIVOT-Q 使用短期内贴现累积差异来识别脆弱状态,应用阶段平衡稀疏监督,并使用行为锚来防止不必要的更改。七种 LIBERO-Plus 环境变化下的实验证明了多种 VLA 骨干模型 和量化方法的一致恢复。值得注意的是,PIVOT-Q 在所有设置中始终优于全状态蒸馏,同时仅使用其状态级蒸馏预算的 7.4%。我们的代码可在 https://github.com/ruanruan-andy/PIVOT-Q. 获取

超越分布内恢复:以脆弱性调优恢复量化 VLA 泛化的原论文方法或结果图
图 2:PIVOT-Q 概述。 PIVOT-Q 使用短期未来段内的贴现累积差异来识别 学生模型 控制的 执行轨迹 中的脆弱状态,执行相平衡稀疏蒸馏,并使用行为锚来保留保留的行为。