论文
CARE:验证视觉语言动作模型推理加速后的性能保持
CARE: Certifying Acceleration for Vision-Language-Action Inference
摘要
虽然视觉-语言-动作(VLA)模型发展迅速,但在每个控制步骤运行它们仍然昂贵。之前的工作使用动作分块和视觉标记修剪等技术加速 VLA 推理,通常根据延迟和平均任务成功率进行评估。然而,加速可能会丢弃信息并破坏原始策略将解决的任务,这是平均指标隐藏的风险。衡量这些失败具有挑战性,因为动作偏差会在闭环轨迹上复合,这意味着任务失败只能在整个事件中观察到。因此,我们通过从相同的初始条件进行配对Rollout来定义加速引起的故障,跟踪参考何时成功但加速策略失败。为了解决这个问题,我们引入了 CARE,一种经过认证的加速器选择方法。 CARE 在校准集上使用配对Rollout来提供有限样本保证,使加速引起的故障风险保持在用户指定的预算以下。它会部署最快的经过认证的候选者,如果没有合格的候选者,则返回参考。通过仅依赖终端结果和测量的计算,CARE 在不同的加速机制中保持不变,而顺序测试和故障触发的参考推出使认证变得经济实惠。在采用 OpenVLA-OFT 的四个 LIBERO 套件上,CARE 证明了 $9.0$--$10.8\times$ 加速,同时保证(在 $95\%$ 置信度下)至少保留 $85.8\%$ 参考解决的情节。在预算紧张的情况下,没有保证的选择器在高达 75\%$ 的试验中超出预算,而 CARE 保持在预算范围内,其顺序形式比详尽评估少使用 78.9\%$ 的部署。 CARE 进一步推广到 $π_{0.5}$ 的流步缩减,以及 Crafter 中的 Qwen3.5-9B 和 Llama-3.1-8B Agent。
