论文

更少的步骤,更好的行动:重新思考 VLA 策略的流量匹配推理

Fewer Steps, Better Actions: Rethinking Flow-Matching Inference for VLA Policies

模型推理推理加速

摘要

基于流匹配的视觉-语言-动作(VLA)策略通过动作专家的重复评估生成动作块。增加集成步骤的数量会增加推理成本,但不一定会提高闭环成功率。我们提出 Coda,它将部分集成预算重新分配给单个学习端点校正。冻结的政策首先完成从噪音到行动的几步轨迹;然后,轻量级 Transformer 使用候选动作、源噪声和共享观察前缀缓存来预测演示监督残差。只有校正员接受过培训。在 50 个 RoboTwin Easy 任务中,五步 Coda 比匹配的五步基线将成功率从 71.64% 提高到 74.68%,同时相对于默认的十步策略将前向延迟减少了 30.2%。两步配置实现了 71.88% 的成功率,加速率为 2.12$\times$。独立的 13 任务控制在几乎相同的延迟下显示出 5.69 个百分点的增益,支持校正作为额外集成的有效替代方案。同样的设计还改进了冷冻官方SmolVLA,将两步成功率从60.8%提高到69.4%。这些结果表明,端点校正改善了冻结流匹配策略的质量与延迟权衡。