论文

粗略控制:视觉-语言-动作模型的动作词元规划

Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models

模型推理推理策略与问题分解

摘要

大多数视觉-语言-动作(VLA)模型直接将观察结果映射到动作,而没有明确的中间计划,这限制了早期错误复合的长期任务的性能。我们提出了 Coarse-to-Control,这是一种计划执行 VLA,它在动作词元空间中引入了原生计划。关键思想是让策略首先预测一个紧凑的粗略动作词元序列,总结预期的未来轨迹,然后根据该计划生成可执行的动作词元。由于计划和执行共享统一的离散动作词汇,因此计划靠近控制流形,并提供直接可操作的指导,而不是必须转换回运动命令的抽象提示。对 LIBERO、SimplerEnv-WidowX 和现实世界操作任务的实验表明,动作词元规划比直接动作生成持续改进,在长期多阶段任务上收益最大。