论文

等待推理时仍能行动:考虑延迟的通用机器人策略强化学习

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

模型训练强化学习

摘要

虽然强化学习 (RL) 允许通用机器人策略在部署过程中不断改进,但现代通用策略(例如 VLA)的大模型规模对有效改进 RL 构成了根本障碍。特别是,它们严重的推理延迟(可能导致暂停或不稳定的运动)可能会改变有效的环境动态,如果没有正确考虑,就会打破强化学习所依赖的马尔可夫假设,导致标准强化学习算法完全失败。在这项工作中,我们引入了一种延迟感知框架,即具有中间信息的异步​​强化学习 (ARLI),该框架能够在推理延迟下基于强化学习改进通用策略。我们的框架建立在异步推理方法的基础上,该方法将动作生成与执行交错以隐藏延迟,并通过提供低延迟的 RL 策略设计来解决其与 RL 的不兼容性问题,该策略设计通过两个贡献最大化推理窗口内的反应性:通过合并提交的动作和中间推理观察来恢复近马尔可夫结构的状态增强。我们在模拟和现实世界的操作任务中评估了我们的方法,发现它可以在标准 RL 完全失败的推理延迟下实现有效的微调,甚至在理想化的无延迟设置中匹配或超过标准 RL 的性能。