论文
作为意图的潜在行动能够为世界行动模型提供有效的未来想象
Latent Action as Intention Enables Efficient Future Imagination for World Action Models
摘要
世界动作模型(WAM)通过对观察结果的演变进行建模来改进机器人控制,但在测试时生成未来的观察结果会导致严重的延迟。 Fast-WAM 删除了这个过程以提高效率;然而,我们的匹配实现显示 Fast-WAM 的通用性低于面向未来的替代方案,特别是在机器人演示稀缺和分布外场景中。为了弥补这一差距,我们引入了 **LAWA**,这是一种 WAM 架构,它使用紧凑的潜在动作作为未来意图的操作表示,从而能够在不生成未来观察的情况下实现高效的测试时未来想象。具体来说,由无操作 预训练 增强的离散分词器生成以操作为中心的码本目标。 LAWA 通过可执行动作块联合对锚定到这些目标的连续潜在状态进行去噪,同时在推理时忽略未来视频分支。在 RoboCasa 上,LAWA 在少量数据和完整数据设置中实现了最先进的平均成功率 65.6% 和 80.8%,比匹配的 Fast-WAM 基线分别提高了 9.6 和 4.5 个点。它还保留了匹配的 Joint-WAM 变体的性能水平,同时要求推理延迟降低 42.9%。 LAWA 还在 LIBERO-Plus 上展示了有竞争力的零样本鲁棒性以及在实际任务中的卓越性能。这些结果表明,未来的想象力不需要被丢弃:通过紧凑的潜在动作保留它可以在性能、泛化和延迟之间产生有效的权衡。代码和模型将被发布。