论文

上下文 VLA:通过上下文 后训练 和代理工具使用赋予视觉-语言-动作模型语言

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

模型训练监督微调与指令调优

摘要

视觉—语言—动作(VLA)模型已成为通用机器人操作的主要方法,但几乎都采用行为克隆:在静态图像和固定指令条件下模仿专家动作块。一种直观改进是通过文本思维链加入显式推理。本文通过实验和分析表明,自由形式文本思维链会削弱底层控制:推理缺少视觉依据,延迟破坏闭环时序,且推理词元与动作词元的优化目标相冲突,使策略学会叙述而不是行动。因此,VLA需要的是理解有依据的语言,而非自行生成语言。本文通过两部分赋予模型语言能力:上下文后训练,将感知证据注入结构化上下文,仅以动作作为监督目标;智能体工具调用接口,让策略查询开放词汇检测器、单目深度和视觉语言模型,主动获得任务相关信息。数据引擎不只生成单一模板描述,而是提供多样化、改写且基于证据的空间描述,使策略能够理解从未见过原句的语言。在RoboCasa-GR1、SimplerEnv、LIBERO三个仿真基准和八项真实机器人操作任务中,与匹配配置下的思维链方法比较,性能与效率均达到最先进结果。