论文
在文本与图像中思考:面向长程机器人操作的交错视觉-语言推理轨迹
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
摘要
长程机器人操作需要既逻辑连贯又几何落地的规划。现有的视觉-语言-动作(Vision-Language-Action)策略通常把规划隐藏在潜在状态中,或只暴露单一模态:纯文本思维链能编码因果顺序但缺失空间约束,而视觉预测提供几何线索但往往局限于局部且语义约束不足。我们提出交错视觉-语言推理(Interleaved Vision--Language Reasoning,IVLR),一个围绕显式中间表示(轨迹trace)构建的策略框架,该表示在整个任务时程上交替呈现文本子目标与视觉关键帧。测试时,单个原生多模态transformer根据初始观测和指令自生成这一全局语义-几何轨迹,将其缓存,并以该轨迹、原始指令和当前观测为条件驱动闭环动作解码器。由于标准机器人数据集缺少此类轨迹,我们通过对演示进行时间分段、并用视觉-语言模型为每个阶段生成描述来构造伪监督。在长程操作与视觉分布偏移的模拟基准上,IVLR在LIBERO上达到95.5%的平均成功率,其中LIBERO-Long为92.4%,在SimplerEnv-WidowX上总体成功率为59.4%。消融实验表明两种模态缺一不可:没有轨迹时LIBERO-Long成功率降至37.7%;纯文本和纯视觉轨迹分别达到62.0%和68.4%,而完整的交错轨迹达到92.4%。执行扰动与轨迹内容掩码的压力测试显示性能中度下降,表明该轨迹能容忍局部损坏和中度执行漂移,但在全局计划过期或不正确时仍然受限。
