论文

XGenAct:跨任务生成增强几何的世界动作模型

XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation

摘要

世界动作模型(WAM)通过预测观测与动作随时间的演化推进了机器人控制。尽管如此,基于RGB与动作的未来预测并未显式处理机器人操作所需的空间理解。既有努力常通过专用头或分支加入有限的空间预测任务,使空间监督的范围与模型架构都碎片化。我们提出XGenAct——把RGB观测、机器人动作、度量深度、表面法线与功能角色分割经确定性编解码表示为RGB视频的世界动作模型:训练时采样感知与动作任务,XGenAct用一个视频扩散transformer与一个目标学习跨这些空间的时间预测,无需模态特定的学习头。在留出RLBench任务上,结构化感知训练较纯RGB训练改善平均闭环成功率;五任务外部对比中XGenAct达52%成功率,最强受评基线为26%。它对未来深度与分割的预测也比先RGB再接冻结感知专家的受评管道更准确。