论文

KineWorld:用于体现世界建模的动作诱导传输场

KineWorld: Action-Induced Transport Fields for Embodied World Modeling

模型架构新型架构

摘要

具身世界模型在执行前预测候选动作的视觉后果。然而,现有的以动作为条件的世界模型通常采用统一加权的视觉生成目标,这些目标可能与具体的预测需求不一致。即使使用明确的运动调节,这些目标也可能会低估对交互至关重要的空间稀疏变化。我们提出了 KineWorld,一种传输感知的世界建模框架,它将机器人运动学从运动调节扩展到生成监督的空间分配。运动传输提升 (KTL) 根据命令的机器人运动构建渲染器衍生的、与相机对齐的传输场。传输感知世界扩散 (TAWD) 在视频潜在网格上校准其运动支持,并通过均匀和传输重点分布的归一化混合重新加权未来 RGB 流匹配。我们使用 RoboTwin 2.0 的 ALOHA-AgileX 双手操作数据来训练 KineWorld。 KineWorld在单视图评估中获得了68.95的EWMScore-P,在多视图评估中获得了54.82的TWB-Score。这些结果支持从外观拟合到具体决策的行动结果建模的转变。

KineWorld:用于体现世界建模的动作诱导传输场的原论文方法或结果图
图2:KineWorld概览。运动传输提升 (KTL) 将受控机器人执行轨迹转换为相机对齐的传输,并将其潜在表示注入为干净的结构条件。传输感知世界扩散 (TAWD) 校准传输支持并为流量匹配目标导出平均token权重,强调固定权重预算下的动作响应区域。加权分支仅在训练期间使用,而继承的动作专家保持不变。