论文

学习协助:用于隐式人机协作的协作 VLA

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration

模型推理解码与生成控制

摘要

人机协作(HRC)结合了人类和机器人的互补优势,以提高任务效率。然而,许多现有的协作系统依赖于手工设计的管道,限制了其新任务的可扩展性和灵活性。在这项工作中,我们展示了通过模仿学习进行端到端训练的模型,特别是视觉语言动作(VLA)模型,可以支持协作操作,并描述影响其现实世界表现的关键因素。我们评估了两个最先进的模型,并确定了隐式 HRC 中动作分块策略的失败模式,其中演示动作泄漏(即跨越潜在任务转换的动作块)可能会导致过早的辅助行为。我们发现这个问题随着执行时间的延长而增加,并且发生在现实世界的协作 VLA 系统中,例如当机器人试图在人准备好之前移交工具时。我们提出了一种推理时间引导方法来减少这些错误的辅助操作,同时保持策略性能。最后,通过一项由 16 名参与者参与的长期协作组装任务用户研究,我们表明,与短期策略相比,引导可以实现更长的执行范围,同时减少过早的协助,从而实现更快的协作并减少失败。