论文

指导、思考、行动:视觉-语言-动作模型中的交互式具身推理

Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

模型推理推理策略与问题分解

摘要

在本文中,我们提出了 GTA-VLA(Guide、Think、Act),这是一种交互式视觉-语言-动作(VLA)框架,允许用户通过明确的视觉提示指导机器人策略,从而实现空间可操纵的具体推理。现有的 VLA 模型学习从多模态观察到机器人动作的直接“感知到行动”映射。虽然在训练分布中有效,但这种紧密耦合的策略在域外 (OOD) 变化下很脆弱,并且在发生故障时难以纠正。尽管最近体现的思想链(CoT)方法公开了中间推理,但它们仍然缺乏结合人类空间引导的机制,限制了它们解决视觉模糊或从错误中恢复的能力。为了解决这一差距,我们的框架允许用户选择使用空间先验(例如可供性点、框和痕迹)来指导策略,后续推理过程可以直接以这些先验为条件。基于这些输入,该模型生成一个统一的空间视觉思想链,将外部指导与内部任务规划相结合,使人类视觉意图与自主决策保持一致。对于实际部署,我们进一步将推理模块与轻量级反应动​​作头结合起来,以实现高效的动作执行。大量的实验证明了我们方法的有效性。在域内 SimplerEnv WidowX 基准测试中,我们的框架实现了最先进的 81.2% 成功率。在 OOD 视觉变化和空间模糊下,单一视觉交互比现有方法大大提高了任务成功率,突出了交互式推理对于具体控制中故障恢复的价值。该项目的更多详细信息可以在这里找到:https://github.com/FutianLabs/GTA-VLA。