论文
预测未来还不够:为机器人学习可执行的终态目标
Predicted Futures Are Not Enough: Learning Executable Goals for Robot Manipulation
摘要
生成世界模型提供了关于操作场景如何朝着任务目标演变的丰富预测,但这些未来并没有直接暴露控制所需的紧凑任务变量。当训练仅监督未来预测时,即使几何恢复可用,最终目标准确性也不是明确的学习目标。我们提出了实体级目标读出,这是一个学习的预测到执行的接口,它使可执行的终端目标成为 3D 跟踪世界模型的显式输出。它将以对象为中心的姿态预测与基于观察深度的平移相结合,以在 SE(3) 中产生紧凑的目标。共享的 Pose-Native Executor 通过在线对象姿势反馈来消耗这个固定目标,以进行闭环控制,而无需重新运行世界模型。在五个操作任务中,该管道的平均成功率为 79.69%。目标诊断直接测量最终目标的准确性,而受控翻译扰动则表征目标错误下执行力如何下降。 Franka 臂上的零样本部署在标称 StackCube 上取得了 73.33% 的成功率,在使用干扰器的情况下取得了 66.67% 的成功率,在 PickPlate 上取得了 75.00% 的成功率(在策略训练期间未看到目标)。这些结果支持将预测到执行接口视为世界模型规划的显式学习组件,而不是控制管道本身的附带后处理。项目页面:https://claire0730.github.io/executable-goals/
