论文

目标:使用空间价值图进行意图感知统一世界行动建模

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

模型架构新型架构

摘要

预训练的视频生成模型为机器人控制提供了强大的先验,但现有的统一世界动作模型仍然难以在没有大量针对机器人的训练的情况下解码可靠的动作。我们将此限制归因于结构不匹配:虽然视频模型捕捉场景如何演变,但动作生成需要明确推理在哪里交互以及潜在的操纵意图。我们引入了 AIM,这是一种意图感知的统一世界行动模型,它通过显式的空间接口弥合了这一差距。 AIM 不是直接从未来的视觉表示中解码动作,而是预测一个对齐的空间值图,该图对与任务相关的交互结构进行编码,从而实现未来动态的面向控制的抽象。 AIM 基于预训练的视频生成模型而构建,在共享的 Transformer 混合架构中对未来的观察结果和价值图进行联合建模。它采用意图因果注意力,仅通过值表示将未来信息路由到操作分支。我们进一步提出了一个自我 蒸馏 强化学习阶段,该阶段冻结视频和价值分支,并使用从投影价值图响应和稀疏任务级信号中获得的密集奖励仅优化动作头。为了支持训练和评估,我们构建了一个包含 30K 操作轨迹的模拟数据集,其中包含同步的多视图观察、动作和值图注释。 RoboTwin 2.0 基准测试表明,AIM 的平均成功率达到 94.0%,显着优于之前的统一世界行动基准。值得注意的是,这种改进在长视野和接触敏感操作任务中更为明显,证明了显式空间意图建模作为视觉世界建模和机器人控制之间桥梁的有效性。