论文

出去和回来:Real2Sim2Real 协同训练中的世界和行为基础

Getting Out and Getting Back: World and Behavior Grounding in Real2Sim2Real Co-Training

模型训练监督微调与指令调优

摘要

模拟可以扩大联合训练稀缺的真实演示,但世界的保真度和人类行为的相似性如何影响政策绩效仍不清楚。我们区分世界基础和行为基础,前者将模拟与真实系统对齐,后者将模拟轨迹与人体运动对齐。我们构建了一个 real2sim2real 管道,该管道独立地改变这些轴以生成用于协同训练的数据。在动态灵巧的挑选和分类任务中,充分grounding的协同训练将成功率从 52% 提高到 86%;跨配置的平均结果是,世界grounding将成功率提高了 18 个百分点,行为grounding提高了 10 个百分点。部署的策略的行为就像真实派生和模拟派生策略的混合体,模仿所覆盖州的真实演示并依赖其他地方的模拟行为,我们通过潜空间分析对其进行检查。总之,这些结果表明了互补的作用:世界基础让政策可以使用超出真实数据覆盖范围的模拟经验,而行为基础主要在世界基础不完善时发挥作用。在协同训练基础模型时,grounding模拟仍然很有用。