论文

流程控制:通过简单的实时输入引导视觉-语言-动作模型

Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs

模型推理解码与生成控制

摘要

我们引入了视觉-语言-动作 (VLA) 模型的流程控制,这是一种通过通用输入(例如键盘)实时引导 VLA 动作的简单而有效的方法。此方法可以开箱即用,不需要重新训练或 微调 VLA。它允许相对粗略的用户输入来引导 VLA 与用户意图保持一致。 VLA将这些输入转换为从训练过程中学习到的VLA专家动作分布中抽取的动作样本,从而生成的动作具有高质量(符合动作专家分布)和高保真度(反映用户意图)。我们证明流控制具有许多理想的特性:(1)流控制根据用户输入准确且响应地引导机器人动作,(2)它对次优用户输入具有鲁棒性,(3)它使用户能够引导 VLA 以实现更高的成功率和更快的任务完成速度,以及(4)微调 流控制轨迹上的 VLA 改进了自主策略。总之,这些结果为用户提供了一种简单直观的方法来帮助引导 VLA 操作,从而提高任务性能。