论文

SimForcing:将仿真运动先验提炼为实域机器人世界模型

SimForcing: Distilling Simulation Motion Priors into Real-Domain Robot World Models

模型架构新型架构

摘要

动作调节的机器人世界模型必须精确响应机器人轨迹,同时保留逼真的视觉动态,但从异构机器人视频中学习仍然具有挑战性。模拟提供结构化运动监督,但外观差异阻碍了直接传输,并且不准确的模拟预测可能会误导真实视频的生成。我们提出了 SimForcing,这是一个模拟引导框架,它使用模拟作为可转移运动知识的来源和预测的可控参考。首先,我们通过潜在运动蒸馏从模拟教师模型转移运动知识,对齐潜空间中的时间变化以内化运动先验,同时减轻外观差异的影响。其次,我们引入了具有条件丢失的多块模拟调节,以利用预测的模拟轨迹,而不会过度依赖其准确性。我们的模拟调节无分类器引导方案通过平衡基于内化运动知识的预测与由模拟潜变量额外引导的预测,统一了这两种想法。联合训练的学生模型生成模拟条件和实域视频,推理时不需要额外的世界模型。在 Bridge 上,SimForcing 在没有外部嵌入预训练的情况下在比较方法中实现了最佳的 PSNR、SSIM、LPIPS 和 FVD。对 InternData-A1 的评估进一步支持了其在机器人数据集上的适用性。此外,使用我们训练有素的世界模型来初始化视觉-语言-动作模型可以提高 LIBERO 的成功率,表明它对于下游策略学习的实用性。 \url{https://github.com/Wang-Xiaodong1899/SimForcing}

SimForcing:将仿真运动先验提炼为实域机器人世界模型的原论文方法或结果图
图 2:SimForcing 概述。模拟世界模型训练:变形金刚混合世界模型从增强合成执行轨迹中学习动作条件运动。模拟到真实的蒸馏:预训练模型初始化学生模型并用作冻结的教师模型。潜在运动蒸馏将运动先验内在化,而多块丢失调节提供模拟指导。联合训练使最终的学生模型能够生成模拟条件和真实视频,CFG在推理时平衡显式指导和内化知识。