论文

流匹配 VLA 中任务相关计算分配的提前退出解耦

Decoupled Early Exits for Task-Dependent Compute Allocation in Flow-Matching VLAs

模型推理推理加速

摘要

流程匹配视觉语言动作 (VLA) 模型已成为通用机器人控制的潜在解决方案,其设计方法是将预训练的视觉语言模型 (VLM) 主干与生成连续机器人动作的动作专家相结合。虽然这些模型表现出令人印象深刻的能力,但由于参数数量非常多,它们的计算要求通常对于机器人控制来说是令人望而却步的。为了缓解这些低效率问题,现有方法主要跳过 VLM 主干层并提前退出或减少去噪步骤,同时保持动作专家深度不变。我们提出了一个框架,将骨干深度 $V$、动作专家深度 $A$ 和去噪步骤 $D$ 公开为 VLA 中的三个可联合配置的计算轴。从预训练的 VLA 开始,我们在主干网和动作专家的中间深度附加了轻量级出口Transformer (ET),经过训练将策略的最后一层提取到每个出口中。此外,我们引入了一种 KV 缓存合成机制,该机制可以管理跳过的骨干层的缺失键和值,从而允许操作专家比骨干层更深地退出。最后,我们表明最佳计算预算是依赖于任务的,不同的任务受益于不同的轴和深度。值得注意的是,我们的方法不需要从头开始训练原始策略,并且对于每次退出,SmolVLA 的参数数量仅增加 $2.1\%$,$\pi_{0.5}$ 的参数数量仅增加 $4.1\%$。我们在两个流匹配 VLA(SmolVLA、$\pi_{0.5}$)和两个基准(LIBERO、Meta-World)上验证了我们的方法,揭示了互补效应:$V$ 和 $A$ 分别减少了 FLOP 和延迟,而 $D$ 则改善了两者。我们的联合配置 $(V,A,D)$ 将延迟减少了 $79.2\%$,计算量(FLOPs)减少了 $31.8\%$,同时将平均成功率提高了 $5.6\%$。