论文

ThinkingVLA:机器人操作的交错视觉和语言推理

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

模型推理推理策略与问题分解

摘要

大多数视觉-语言-动作(VLA)模型将观察结果直接映射到动作,而没有明确的推理,这限制了它们推理密集型长期任务的能力。为了解决这个问题,现有方法采用思想链(CoT)推理来实现子目标分解和空间预测。然而,这些方法缺乏有效的跨模态推理的统一架构,并且未能明确包含基于目标状态的逆向推理能力。我们认为,操纵计划自然地分解为预测(预测下一个视觉状态)和逆动态(推断达到目标的动作)。连接两者需要一个统一的自回归架构,在单个生成过程中交错文本和视觉推理。我们提出 \textbf{ThinkingVLA},这是一种生成模型,可以在统一的 Mixture-of-Transformer 架构中实现这种分解。 ThinkingVLA由一个前向CoT组成,它识别直接子目标并指导视觉预测;然后,预测图像作为目标状态,建立逆 CoT,根据预测图像推理空间关系和动作意图;最终的动作是根据这个完整的推理上下文生成的。对模拟和现实世界基准的大量实验表明,ThinkingVLA 始终优于最先进的基线,尤其是在长范围操作任务上取得了巨大的进步。