论文

KAM-WM:来自机器人操作潜在世界模型的运动功能可供图

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

摘要

从少数演示中学习操作需要视觉先验,不仅要捕获交互的位置,还要捕获交互应该如何开始;静态先验(例如分段掩码)仅对前者进行编码。我们提出了 KAM-WM,这是一个框架,可以从冻结的潜在视频世界模型中提取粗略的定向交互线索,而无需轨迹展开或世界模型 微调。 KAM-WM 查询一次流匹配图像到视频主干,并将其单步潜在速度解释为运动学可供性图 (KAM),它提供任务条件交互区域和粗略运动结构。轻量级感知器将 KAM 压缩为标记,这些标记与 RGB 观察和本体感觉一起调节扩散策略。在 LIBERO 和 RoboTwin2.0 中,KAM-WM 在 LIBERO 上达到了 90.6% 的平均成功率,在 RoboTwin2.0 上的 Easy 和 Hard 设置中分别达到了 65.7% 和 22.4% 的成功率。与零阶掩模先验的受控比较表明,部分增益来自于空间定位之外的方向信息。这些结果表明,在评估的设置中,冻结视频模型可以为控制提供有用的一阶视觉先验,而无需未来轨迹展开的测试时间成本。