论文
U-GROW:优先在高不确定状态生成世界模型轨迹
Prioritized Rollouts for Efficient World Model-based Vision-Language-Action Policy Optimization
摘要
视觉-语言-动作(VLA)模型已经成为体现智能的强大范例,但通过强化学习(RL)对其进行微调仍然受到现实世界机器人交互成本的限制。基于模型的强化学习 (MBRL) 通过使用学习的世界模型生成策略优化的部署来降低此成本。然而,随着 VLA 政策和世界模型的扩展,它的计算成本会变得昂贵。现有方法通常对各国一视同仁,忽视了各国在改善政策方面的效用的巨大差异。在本文中,我们表明政策不确定性有助于确定政策改进潜力更大的国家。该政策仅在一小部分国家表现出高度不确定性,通常是在决策敏感阶段,微小的行动差异可能会改变任务结果,这表明这些国家的政策改进可能特别有价值。基于这些发现,我们引入了 U-GROW,这是一个轻量级、即插即用的采样层,可将更多模型部署到这些信息丰富的状态。通过仅修改分支启动分布,U-GROW 可以集成到现有的 MBRL 管道中,而无需更改策略优化目标。模拟和现实操作任务中的实验证明了 U-GROW 的效率和有效性,支持使用政策不确定性来指导经验生成。