论文
引导行动流程:用于流程匹配视觉-语言-行动策略的 Q 引导推理
Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies
摘要
在特定机器人和工作空间上部署预训练的流程匹配视觉语言动作(VLA)策略通常需要针对特定任务的适应,而完整策略 微调 成本高昂并且会改变基本行为。我们提出了引导动作流,这是一种推理时间方法,它使预训练的 SmolVLA 策略保持冻结状态,并利用特定于任务的动作块批评家的梯度来引导其逆时动作流采样。 QGF 通过离线隐式 Q-Learning 在 100 个真实机器人展示中训练视觉 Transformer 批评家和价值模型。机器人状态的临界条件、冻结的双摄像头 SmolVLA 视觉标记以及策略的标准化 50 步动作块。在真实的机器人水瓶放置任务中,\b{eta} = 2 的 QGF 将成功率从 19/40 集 (47.5%) 提高到 34/40 集 (85.0%),并将超时从 13 次减少到 3 次。添加黄色卷尺作为视觉干扰物后,QGF 完成了 6/12 集,而冷冻 SmolVLA 则完成了 0/11 集。这些结果表明,部署部署可以提供有效的行动空间指导信号,用于在没有策略 微调 的情况下改进冻结的流量匹配 VLA。