论文

预测未来还不够:为机器人学习可执行的终态目标

Predicted Futures Are Not Enough: Learning Executable Goals for Robot Manipulation

应用与实践智能体系统模型评测Agent 环境交互模型行为与机制分析机器人

摘要

生成世界模型提供了关于操作场景如何朝着任务目标演变的丰富预测,但这些未来并没有直接暴露控制所需的紧凑任务变量。当训练仅监督未来预测时,即使几何恢复可用,最终目标准确性也不是明确的学习目标。我们提出了实体级目标读出,这是一个学习的预测到执行的接口,它使可执行的终端目标成为 3D 跟踪世界模型的显式输出。它将以对象为中心的姿态预测与基于观察深度的平移相结合,以在 SE(3) 中产生紧凑的目标。共享的 Pose-Native Executor 通过在线对象姿势反馈来消耗这个固定目标,以进行闭环控制,而无需重新运行世界模型。在五个操作任务中,该管道的平均成功率为 79.69%。目标诊断直接测量最终目标的准确性,而受控翻译扰动则表征目标错误下执行力如何下降。 Franka 臂上的零样本部署在标称 StackCube 上取得了 73.33% 的成功率,在使用干扰器的情况下取得了 66.67% 的成功率,在 PickPlate 上取得了 75.00% 的成功率(在策略训练期间未看到目标)。这些结果支持将预测到执行接口视为世界模型规划的显式学习组件,而不是控制管道本身的附带后处理。项目页面:https://claire0730.github.io/executable-goals/

预测未来还不够:为机器人学习可执行的终态目标:论文原图
图 3:系统概览。 Frozen 编码器为跟踪预测和实体级目标读出提供共享的世界模型表示。读数揭示了一个与对象相关的目标,锚定于 t=0t=0 并针对该情节进行固定。在线跟踪和姿态估计更新对象状态以闭合循环。 Pose-Native Executor 结合了姿势、目标、本体感觉和之前的动作,以 2020 Hz 的频率生成八维手臂和夹具命令。