论文
HaWMPO:基于幻觉感知世界模型的通才机器人政策优化
HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
摘要
多面手机器人策略已经在机器人操作任务中表现出了很强的通用性,但在复杂的长期场景中,它们的成功率仍然有限。最近的方法通过对真实机器人的在线强化学习来改进视觉语言动作(VLA)策略,但这种训练依赖于昂贵的物理交互,样本效率低,并且可能引入硬件和安全风险。世界模型通过想象的执行轨迹实现政策优化,提供了一个有前途的替代方案。然而,世界模型产生的长程轨迹常常会受到预测幻觉的影响,产生有偏差的状态转换,从而误导政策学习。为了解决这个问题,我们提出了基于幻觉世界模型的策略优化(HaWMPO),这是一种针对具有世界模型的 VLA 策略 后训练 的闭环强化学习管道。具体来说,HaWMPO引入了一种动作条件幻觉感知模型来估计生成图像序列的可靠性,并通过Reward-Soft机制将幻觉分数纳入群体相对策略优化中,在训练期间抑制不可靠的动作块。在 LIBERO 基准上,HaWMPO 取得了最佳的平均成功率,比基础模型提高了 15.0%,比最强基线提高了 2.8%; G1机器人的真实实验进一步验证了其有效性,将两次操纵任务的平均成功率从67.5%提高到80.0%。