论文

Facet-0:用于接触丰富的精确操作的机器人基础模型

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

模型训练强化学习

摘要

现实世界中亚毫米公差的机器人装配需要空间精度、合规交互以及对接触故障的鲁棒性。我们提出了 Facet-0,这是一个机器人基础模型,可以预测并评估其行为的接触后果。 Facet-0 围绕联合动作扳手提案统一了多模态表示学习和强化学习 (RL) 后训练:因果扳手历史与视觉语言语义和运动学状态保持一致,流匹配生成每个动作块以及预期引发的未来手腕扳手轮廓。部署部署训练分布式行动扳手批评家来区分具有相似任务进度但不同接触结果的动作,而阶段感知奖励和接触选择性信用将政策改进集中在决定性交互上。为了适应特定于零件的动态,轻量级有界策略模型重复使用冻结的表示来进行机器人适应; RL 仍然定义为可执行的笛卡尔动作,而辅助扳手头保留了预测性的、非命令的动作接触耦合。在 ManuFacet-1K(一个跨越三个实施例和多个制造单元的 1,000 小时力同步语料库)上进行训练后,有界任务适应系统在 0.5 毫米的放置精度和 50 毫秒的命令延迟下,在五个亚毫米计算机组装任务上达到了 82% 的平均成功率,而最强基线的平均成功率为 15%。