论文

HIL-UMI:将视觉-语言-动作模型的人在环后训练引入通用操作界面

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

模型训练监督微调与指令调优

摘要

大规模视觉语言动作(VLA)模型为机器人操作提供了强大的先验,但使它们适应特定的部署仍然具有挑战性。针对特定任务演示的监督微调(SFT)为部署迈出了一步,但面临两个持续的限制:静态数据对分布外状态的覆盖范围有限,而标准模仿目标无法区分进步行为和不太有用的数据。交互式后期训练可以解决这些限制,但通常需要对物理机器人进行重复的策略执行和人工干预。我们推出了 HIL-UMI,这是一种策略引导的通用操作接口 (UMI) 框架,用于无机器人的人在环 VLA 后期训练。在手持式 UMI 演示期间,HIL-UMI 查询同一观察流上的当前策略,而不执行其预测。能量得分将人类行为轨迹与政策推理进行比较,并在其差异表明存在分布外区域时触发收集。在单独的反馈循环中,低在线优势预测确定了改进基于进度的优势估计器的重要部分。然后,更新后的估计器使用基础演示和新政策数据的平衡组合来指导优势条件行为克隆。这种设计保留了人机循环学习的迭代和策略感知性质,同时将数据收集与机器人部署解耦。对跨越长视野和精确操作的四个现实世界任务的实验表明,HIL-UMI 相对于 SFT 实现了持续改进,并受益于有针对性的收集和优势细化。此外,HIL-UMI 在清理表上的表现优于 HG-DAgger,每帧收集时间较短,这为跨操作员和位置的 VLA 后期训练提供了可扩展的路径。