论文

ComManip:过度拟合舒适区域的操纵策略

ComManip: Overfitting Manipulation Policies to Comfortable Regions

摘要

训练机器人操纵策略依赖于昂贵的机器人演示,使得大规模数据收集变得不切实际。同时,为了提高策略的泛化性,现有方法通过在数据收集过程中改变对象放置、视点和机器人配置来寻求视觉观察的更大多样性。然而,在有限的示范预算下,该策略迫使政策对不同的视觉观察进行建模,为在类似的当地条件下学习可靠的观察-行动对应关系提供足够的监督。我们的研究表明,在该策略下训练的策略比在紧凑、视觉和运动稳定的区域中训练的策略实现的任务成功率更低。我们将这些稳定区域称为舒适操纵区域。为了利用这一发现,我们提出了 ComManip,一种专门针对舒适操纵区域的操纵策略的学习范式。在推理过程中,ComManip 会重新定位移动底座,直到检测到的目标中心进入根据舒适区域演示估计的熟悉的图像空间范围。然后它执行相同的操纵策略,从而实现跨不同目标位置的有效操纵。我们在多个操作任务、演示预算和策略系列(包括 ACT、$π_{0.5}$、RDT、OpenVLA-OFT 和 SmolVLA)中进行了广泛的实验。结果表明,在有限的演示预算下,ComManip 在大型工作空间中的不同策略架构中将任务成功率提高了大约 20 个百分点或更多,这表明针对舒适区域的专门操纵策略为操纵提供了更有效的数据效率学习范例。