论文

通过行动词元干预引导自回归视觉-语言-行动政策

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

模型推理解码与生成控制

摘要

我们提出了词元引导(TS),这是一种通过直接干预动作词元空间来动态引导由自回归视觉语言动作(VLA)模型生成的轨迹的方法。 TS 将低维用户输入注入模型的本机动作词元表示中,允许用户影响轨迹生成,而无需修改底层视觉语言模型 (VLM) 架构。由于 TS 完全在推理时运行,因此不需要额外的训练或微调。用户输入引导而不是覆盖预先训练的策略,允许用户影响机器人的动作,同时保留 VLA 学到的灵活性、平滑性和任务先验。我们在两项家庭操作任务(对象放置后抽屉关闭和状态感知对象交换)上评估 TS,并将成功率分别从 10.0% 提高到 72.5% 和从 16.7% 提高到 93.8%。通过在机器人基础模型上实现轻量级、直观的转向,我们的界面有可能改善消费者环境中的人机交互,并为物理控制能力有限的个人扩大可访问性。项目网站:https://jasontchan.github.io/token-steering/ 。