论文
VLBiMan++:扩展视觉语言锚定单次双手操作的泛化边界
VLBiMan++: Expanding the Generalization Boundary of Vision-Language Anchored One-Shot Bimanual Manipulation
摘要
可推广的双手机器人操作需要一个可重复使用的任务先验,该任务可以在日益多样化的任务、对象、场景、实施例和执行条件中持续存在,从而避免大规模远程操作演示和策略再训练的高昂成本。在这项工作中,我们提出了 VLBiMan++,这是一种扩展框架,它扩展了视觉语言锚定单次双手操作的泛化边界。从单个人类演示开始,VLBiMan++ 执行任务感知分解,以识别可重用和适应性强的技能组件,并采用基于视觉语言的几何适应将这些技能转移到新颖的配置,而无需重新训练。在此基础上,我们从五个维度系统地扩展泛化:通过多样化和长期技能组合的任务泛化;跨未知类别、不同几何形状以及更复杂的铰接或可变形对象的对象泛化;杂波、遮挡和动态干扰下的场景概括;跨异构双臂机器人平台的实施例泛化;以及通过在重复的外部扰动下长时间闭环执行来实现部署泛化。为了支持更广泛的范围,我们进一步引入了对象状态感知适应和轻量级轨迹优化机制,可以适应简单刚性 6 自由度姿势变化之外的变化,同时保持可靠的双手协调。大量的实际实验表明,VLBiMan++ 在这些日益具有挑战性的环境中保持了强大的任务成功率和适应能力。总体而言,VLBiMan++ 将一次性双手操作从展示孤立的可转移性发展为更系统和可扩展的框架,以跨任务、对象、场景、实施例和长期部署条件进行泛化。