论文

帮助:具有分段功能的人性化大型机器人 后训练

HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

模型训练合成数据

摘要

当将视觉语言动作(VLA)模型应用于下游任务时,通常需要多轮 后训练 来逐步解决策略弱点。在本报告中,我们重点关注在此迭代过程中最大限度地提高人员效率,通过政策改进和每单位人力和时间的任务吞吐量来衡量。我们提出了 HELP,一种高效的大型机器人 后训练 管道,其中两名专业操作员同时监督 12 台机器人。训练有素的远程操作员提供高价值的远程干预和恢复演示,而地面操作员则监视机器人车队、触发接管并执行物理重置。这种角色专业化通过减少任务切换、降低操作员训练成本和扩大机器人交互覆盖范围来提高人类效率。除了增加执行轨迹量之外,并发监督还扩大了人类团队观察到的政策行为的范围,使重复出现的故障模式更容易识别,并实现更有针对性的接管、重置和恢复演示。为了有效利用大量混合质量的执行轨迹数据,HELP 结合了 \vlac,这是专门为此设置设计的自动执行轨迹分段评估器。它将自主轨迹分为进展、空闲、引发故障和恢复部分。有用的执行轨迹部分将被保留,并与下一轮 后训练 的人机交互数据相结合。在四个现实世界的操作任务中,HELP 实现了 80\%--95\% 的成功率,并将任务吞吐量比基本模型提高了 1.7$\times$--4.2$\times$。在匹配的 HITL 恢复预算下,与仅 HITL 更新相比,VLAC-CUT 进一步将吞吐量提高了 1.20$\times$--3.43$\times$,成功率提高了 1.50$\times$--3.00$\times$。