论文
$R^3$:通过强化学习训练机器人以自然语言进行推理
$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning
摘要
语言推理允许基础模型在困难问题上花费更多的测试时间计算,例如需要分解、约束跟踪和预测未来后果的问题。这种机制是否可以改善机器人操作仍不清楚,长期任务需要跟踪部分进度、推理对象关系、从错误中恢复以及引导嘈杂的底层策略。在本文中,我们研究是否可以训练 VLM 直接用自然语言进行推理,以指导底层操作策略。我们引入 $R^3$,这是一个简单的 后训练 配方,可将现成的 VLM 转变为机器人推理器:它首先在专家生成的推理轨迹上对 VLM 进行中期训练,以初始化所需的推理风格,然后使用基于离线操作数据的单步基于规则的 RL 改进推理器。与之前主要使用结构化痕迹作为辅助监督的机器人推理方法不同,$R^3$ 训练自由形式语言推理以生成测试时的行动指导。我们在语言表和模拟双手杂货包装上实例化 $R^3$,这是两个用于研究机器人推理和长视野操作的受控测试平台。 $R^3$ 改进了对未见过的任务的探索和泛化,并且在两个基准上都显着优于仅指令模仿学习基线。我们的分析表明,自由形式语言推理可以作为指导底层策略的测试时计算机制。我们的项目页面位于 https://robotic-reasoner.github.io/。