论文
通过语义强化学习调整通用机器人策略
Adapting Generalist Robot Policies with Semantic Reinforcement Learning
摘要
通用机器人策略通过大规模预训练学习多种行为。原则上,这使它们成为通过强化学习(RL)进行下游适应的优秀先验。然而,在实践中,标准强化学习方法利用这种先验直接优化机器人动作,要求基本策略的动作分布从一开始就接近高性能策略的分布。对于超出预训练分布的复杂或长期任务,这种假设不成立。我们的主要见解是,对于具有足够表达能力的通才政策,语言提示是学习解决此类任务的有效替代空间:调节语言输入可以引出政策库中已有的技能,这些技能可以组合起来解决超出其零样本能力的任务。我们提出语义动作强化学习(SARL),它学习通过在线交互来优化这个提示空间,将通才策略视为可控技能先验。重要的是,利用预先训练的技能而不是从头开始学习新技能,可以产生结构化的、语义上有意义的探索和高效的在线改进,并且学习通过经验调节提示,使它们能够在现实世界中诱导行为,从而实现稳健的任务解决。在现实世界的设置和模拟基准中,我们展示了 SARL 解锁了全新的功能——调整 VLA 行为来解决复杂的长期任务——并且在改善部署中的机器人行为方面显着优于现有方法。