论文

先移动后操作:类人机器人操作的行为阶段

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

摘要

我们提出了“移动然后操作”(Move-Then-Operate),这是一种视觉语言动作框架,它将机器人操作明确地解耦为两个不同的行为阶段:粗略重定位(移动)和接触关键交互(操作)。与混合这些异构机制的整体策略不同,我们的架构采用了由可学习阶段选择器路由的双专家策略,引入了隔离特定阶段动态的结构归纳偏差。阶段标签是通过基于 MLLM 的管道自动生成的,该管道以轻量级上下文线索为条件,例如末端执行器速度和子任务分解,以确保与人类运动模式保持一致。在 RoboTwin2 基准上进行评估,我们的方法实现了 $68.9\%$ 的平均成功率,比整体 $π_0$ 基线高出 $24\%$。它匹配或超过了使用 10倍数据进行训练的模型,并以减少40%的训练步骤达到了峰值性能,这表明移动和操作阶段的架构解开是掌握高精度操作的一种非常有效和高效的策略。