论文

CARE:验证视觉语言动作模型推理加速后的性能保持

CARE: Certifying Acceleration for Vision-Language-Action Inference

模型评测模型推理应用与实践推理加速评测方法与指标机器人

摘要

虽然视觉-语言-动作(VLA)模型发展迅速,但在每个控制步骤运行它们仍然昂贵。之前的工作使用动作分块和视觉标记修剪等技术加速 VLA 推理,通常根据延迟和平均任务成功率进行评估。然而,加速可能会丢弃信息并破坏原始策略将解决的任务,这是平均指标隐藏的风险。衡量这些失败具有挑战性,因为动作偏差会在闭环轨迹上复合,这意味着任务失败只能在整个事件中观察到。因此,我们通过从相同的初始条件进行配对Rollout来定义加速引起的故障,跟踪参考何时成功但加速策略失败。为了解决这个问题,我们引入了 CARE,一种经过认证的加速器选择方法。 CARE 在校准集上使用配对Rollout来提供有限样本保证,使加速引起的故障风险保持在用户指定的预算以下。它会部署最快的经过认证的候选者,如果没有合格的候选者,则返回参考。通过仅依赖终端结果和测量的计算,CARE 在不同的加速机制中保持不变,而顺序测试和故障触发的参考推出使认证变得经济实惠。在采用 OpenVLA-OFT 的四个 LIBERO 套件上,CARE 证明了 $9.0$--$10.8\times$ 加速,同时保证(在 $95\%$ 置信度下)至少保留 $85.8\%$ 参考解决的情节。在预算紧张的情况下,没有保证的选择器在高达 75\%$ 的试验中超出预算,而 CARE 保持在预算范围内,其顺序形式比详尽评估少使用 78.9\%$ 的部署。 CARE 进一步推广到 $π_{0.5}$ 的流步缩减,以及 Crafter 中的 Qwen3.5-9B 和 Llama-3.1-8B Agent。

CARE:验证视觉语言动作模型推理加速后的性能保持:论文原图
图 1:护理概述。给定参考策略 π0\pi_{0} 和加速候选策略 Λ={λ1,…,λM}\Lambda=\{\lambda_{1},\ldots,\lambda_{M}\},care 首先在不相交的分析集中分析候选延迟,并对候选从最快到最慢进行排序。在单独的校准集上,候选者在任务平衡的轮次中按顺序进行评估,每轮包含每个任务中相同数量的情节。对于每个配对的校准episode,参考和加速策略从相同的评估单元UU开始,并且care记录episode级损失Lλ(U)=Y0(U)(1−Yλ(U))L_{\lambda}(U)=Y_{0}(U)\bigl(1-Y_{\lambda}(U)\bigr),仅当参考成功而加速策略失败时,它才等于1。具有家庭明智错误控制的随时有效的测试可以对考生进行认证,同时允许提前停止。为了降低校准成本,仅当候选失败时才执行参考策略,并且其结果被缓存以供重用。护理返回第一个,因此也是最快的,经过认证的候选项;如果没有一个可以被证明,则保留 π0\pi_{0}。返回的策略满足有限样本部署保证,而不会增加推理开销。