论文

机器人控制的上下文世界建模

In-Context World Modeling for Robotic Control

上下文与知识上下文工程

摘要

现代视觉-语言-动作(VLA)模型通常无法推广到新颖的设置,例如改变的相机视角或机器人形态,因为它们通常仅以当前观察和语言指令为条件。通过忽略底层系统配置作为变量,这些模型隐式地假设训练期间遇到的固定执行上下文,从而需要针对任何新环境使用数据密集型 微调。在这项工作中,我们引入了上下文世界建模(ICWM),这是一个将系统识别视为上下文适应问题的框架。 ICWM 使机器人策略能够从自我生成的、与任务无关的交互的简短历史中自主推断出基本的系统变量。与使用演示来指定要执行的任务的传统情境学习不同,ICWM 利用情境窗口来了解系统的运行方式。通过在任务执行之前处理这些交互,该模型隐式地捕获当前系统的世界动态,从而无需更新参数即可适应新的配置。模拟和现实机器人平台上的大量实验表明,ICWM 在新颖的相机视点上显着优于标准 VLA 基线。