论文

在文本与图像中思考:面向长程机器人操作的交错视觉-语言推理轨迹

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

摘要

长程机器人操作需要既逻辑连贯又几何落地的规划。现有的视觉-语言-动作(Vision-Language-Action)策略通常把规划隐藏在潜在状态中,或只暴露单一模态:纯文本思维链能编码因果顺序但缺失空间约束,而视觉预测提供几何线索但往往局限于局部且语义约束不足。我们提出交错视觉-语言推理(Interleaved Vision--Language Reasoning,IVLR),一个围绕显式中间表示(轨迹trace)构建的策略框架,该表示在整个任务时程上交替呈现文本子目标与视觉关键帧。测试时,单个原生多模态transformer根据初始观测和指令自生成这一全局语义-几何轨迹,将其缓存,并以该轨迹、原始指令和当前观测为条件驱动闭环动作解码器。由于标准机器人数据集缺少此类轨迹,我们通过对演示进行时间分段、并用视觉-语言模型为每个阶段生成描述来构造伪监督。在长程操作与视觉分布偏移的模拟基准上,IVLR在LIBERO上达到95.5%的平均成功率,其中LIBERO-Long为92.4%,在SimplerEnv-WidowX上总体成功率为59.4%。消融实验表明两种模态缺一不可:没有轨迹时LIBERO-Long成功率降至37.7%;纯文本和纯视觉轨迹分别达到62.0%和68.4%,而完整的交错轨迹达到92.4%。执行扰动与轨迹内容掩码的压力测试显示性能中度下降,表明该轨迹能容忍局部损坏和中度执行漂移,但在全局计划过期或不正确时仍然受限。

在文本与图像中思考:面向长程机器人操作的交错视觉-语言推理轨迹:论文配图
图 1:用于长视野控制的交错推理轨迹。标准的端到端 VLA 策略通常直接根据当前的观察和指令来预测行动或短期局部未来。 IVLR首先生成由文本子目标和视觉关键帧组成的全视野IVLR-Trace,然后使用缓存的轨迹与当前观察和指令一起进行闭环动作解码。