论文

$π_0$-EqM:闭环视觉-语言-动作控制的平衡匹配

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

模型推理解码与生成控制

摘要

目前,视觉-语言-动作(VLA)模型因其任务泛化的巨大潜力而​​成为机器人操作最常用的范例。虽然大多数用于 VLA 控制的生成流匹配动作解码器通常部署有固定的采样范围,但限制了状态相关的计算和跨控制周期的时间重用。我们提出了 $π_0$-EqM,它用平衡匹配 (EqM) 解码器取代了 $π_0$ 中的流匹配专家,同时保持上游 VLA 堆栈不变。在匹配的 300 步预算下,$π_0$-EqM 将 RoboTwin 在 19 项任务中的平均成功率从 40.4% 提高到 50.2%,并且在 LIBERO 上保持竞争力,其中在 LIBERO-10 上的增益最为明显(87.0%)。两个阈值扫描揭示了残差和成功之间依赖于任务的非单调关系,我们将其称为平稳性-可执行性差距。结果表明,迭代 VLA 控制中的推理深度是策略设计的一部分,并引入了基于能量的 VLA 视角,可以为跨任务和实施例的可组合动作生成的未来工作提供信息。