论文

通过代理强化学习学习机器人操作中的鲁棒执行

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

模型训练强化学习

摘要

由于不确定性、长期执行和复合错误,机器人操作带来了根本性挑战,这很容易破坏执行的稳定性并导致任务失败。尽管最近的视觉-语言-动作(VLA)模型表现出很强的泛化性,但它们通常缺乏明确的机制来评估执行稳定性以及在执行偏离其名义行为时进行恢复。在本文中,我们提出:(1)两个互补的指标来评估运行时的执行质量,以及(2)一个代理强化学习框架,该框架学习通过高层决策而不是直接学习低层动作来恢复有效的执行。在这个框架中,代理策略对最近的执行历史进行推理,并在一小部分执行模式中进行选择来调节执行过程。在执行性能下降的情况下,它会触发适当的恢复机制,将机器人恢复到之前访问的标称状态,从而使任务能够继续执行。我们在 LIBERO 基准上评估了所提出的方法,在标准设置下成功率提高了 13.7%,在干扰设置下成功率提高了 39.2%,这表明执行鲁棒性得到了显着增强。