论文
ForeAct3D:策略 - VLA策略的扎根未来世界建模
ForeAct3D: Policy-Grounded Future World Modeling for VLA Policies
摘要
机器人需要预测它们的行为将如何改变世界,因为操纵的成功取决于由此产生的接触和物体运动。然而,现有的视觉-语言-动作 (VLA) 策略通过共享特征预测未来的观察结果,使预测与策略将实际执行的动作脱钩,并且对场景的演变没有施加任何物理约束。我们介绍 ForeAct3D,这是一个在VLA策略中基于策略的未来世界建模框架。可学习的几何查询将深度、语义分割和相机姿势从策略表示解码为当前和未来的语义 3D 场景状态,并且未来的查询以策略生成的动作块为条件,以在计划的交互中进行预测。物理一致性闭合通过背景静态性和实例级刚性将两种状态联系起来,并将手腕相机姿势锚定到末端执行器运动学。这些目标塑造了训练期间用于动作生成的共享表示,并且推理时不需要未来预测。在没有机器人预训练的情况下,ForeAct3D 在 LIBERO 上实现了 98.3% 的平均成功率,在 CALVIN 上实现了 3.73 的平均任务长度,在每个套件上都优于其基础策略。 消融表明,语义 3D 监督、物理一致性和动作调节都可以提高操作性能,并且动作调节可以显着改善未来的对象定位。关于空间放置、对象插入和顺序操作的真实世界实验进一步将基础策略的平均成功率从 6.7% 提高到 37.8%。项目页面和代码可在 https://github.com/anthonytao80-crypto/ForeAct3D. 获取
