论文

对行动块进行定价:实体强化学习的物理关系信用分配

PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

模型训练强化学习

摘要

基于结果的强化学习(RL)使用终端成功信号对视觉-语言-行动策略进行后训练,但为每个行动块分配相同的轨迹级优势。因此,失败的事件可能会惩罚有用的早期行动,就好像它们导致了失败一样。现有的方法通过学习评估器寻求更细粒度的反馈,添加特定于任务的监督或额外的模型训练。据我们所知,我们首次探索跨轨迹的物理关系是否可以在没有辅助评估器的情况下仅从最终结果为体现强化学习提供动作块信用。关键的见解是,达到相应实际情况的推广可以相互参考:它们的最终结果为评估当地进展提供了证据。我们引入了从情节推断信用的物理关系(PRICE),它有两个组成部分:(i)一个物理关系图,它汇集了相应块边界上的当前和历史结果以估计成功潜力; (ii) 置信门控信用分配,利用这些潜力的变化来完善轨迹级监管。我们的分析将预言机的潜在变化与最终成功目标联系起来,并为结果独立的证据池提供了有限样本的方向界限。独立的延续测试表明,PRICE 的保留学分与当地进展一致,而 LIBERO、RoboTwin 2.0 和真实机器人的实验表明,与基于结果的基线相比,任务成功率有所提高,学习速度更快。