论文
LaST-R1:通过自适应物理潜在推理强化机器人操作
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
摘要
机器人基础模型需要对复杂的视觉场景进行推理,以在动态环境中执行自适应动作。虽然最近对潜在推理视觉-语言-动作(VLA)模型的研究已经证明了捕捉细粒度物理动态的能力,但它们仍然主要局限于静态模仿学习,严重限制了它们的适应性和泛化性。在本文中,我们提出了 LaST-R1,这是一种新颖的强化学习 (RL) 后训练 框架,旨在有效利用“潜在推理先于行动”策略。具体来说,我们提出了潜在动作策略优化(LAPO),这是一种核心强化学习算法,可联合优化潜在推理过程和动作生成。通过直接在 RL 优化循环中明确嵌入潜在的思想链 (CoT) 推理,LAPO 刺激了深刻的物理世界建模,从而推动了交互式环境中的稳健执行。此外,引入了自适应潜在 CoT 机制,允许策略根据不同的环境状态动态调整其推理范围。实验表明,LaST-R1 只需一次监督预热即可在 LIBERO 基准上实现近乎完美的 99.9% 平均成功率,与之前最先进的 (SOTA) 方法相比,显着提高了收敛速度和性能。在实际部署中,LaST-R1 在四项复杂任务(包括单臂和双臂设置)上比 SOTA 监督的 微调 方法平均提高了 22.5%。最后,LaST-R1 在模拟和现实环境中展示了强大的泛化能力。