论文

基于块的机器人策略的动态执行范围预测

Dynamic Execution Horizon Prediction for Chunk-based Robot Policies

模型训练强化学习

摘要

动作分块已成为现代机器人策略的标准设计,从扩散/流动策略到视觉语言动作模型,其中策略预测一系列动作并执行固定数量的动作,而不是一次执行一个步骤。然而,这种范例依赖于一个关键假设:固定的执行范围。在块执行期间,该策略以开环方式运行,这对于需要频繁重新规划的细粒度操作任务来说尤其成问题。在实践中,执行范围通常是通过经验调整来选择的,并且高度依赖于任务。为此,我们提出了动态执行水平预测(DEHP),这是一种使用在线强化学习训练轻量级执行水平预测分支的有效方法,同时保持预训练的块策略完全冻结。这使得该方法与黑盒块策略兼容,并将调整执行范围的影响与底层动作生成器的变化隔离开来。在我们的评估中,DEHP 大幅提高了不同高精度和长视野操作任务的成功率。我们的定性分析进一步表明,DEHP 在任务的细粒度阶段预测较短的执行范围,在自由空间运动期间预测较长的执行范围。通过这种方式,DEHP 平衡了开环块执行的效率与闭环单步控制的反应性。项目页面:https://dehp-chunking.github.io/