论文
SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励
SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning
摘要
视觉语言模型(VLM)在不同的任务中表现出了令人印象深刻的能力,激励人们利用这些模型来监督机器人学习。然而,当用作强化学习(RL)中的评估器时,当今最强大的模型通常会在部分可观察性和分布变化的情况下失败,从而使策略能够利用感知错误而不是解决任务。我们引入 SOLE-R1(自观察学习者),这是一种视频语言推理模型,明确设计为在线强化学习的唯一奖励信号。仅在原始视频观察和自然语言目标的情况下,SOLE-R1 会执行每个时间步的时空思维链 (CoT) 推理,并生成可直接用作奖励的任务进度的密集估计。为了训练 SOLE-R1,我们开发了一个大规模视频轨迹和推理合成管道,可生成与持续进度监督保持一致的具有时间依据的 CoT 轨迹。该数据与基于视觉依据的空间和多帧时间推理相结合,并用于通过混合框架训练模型,该混合框架将监督 微调 与来自可验证奖励的 RL 结合起来。在四种不同的模拟环境和真实的机器人设置中,SOLE-R1 可通过随机初始化实现零样本在线强化学习:机器人学习以前未见过的操作任务,无需 真值 奖励、成功指标、演示或特定于任务的调整。 SOLE-R1 在 24 项看不见的任务上取得了成功,并且大大优于强大的视觉语言奖励器,包括 Robometer、RoboReward、ReWiND、GPT-5 和 Gemini-3-Pro,同时对 奖励作弊 表现出明显更强的鲁棒性。我们在匿名页面发布所有模型、数据、代码和演示:https://philip-mit.github.io/sole-r1/