论文
机器人世界模型是否遵循动作?诊断并校准用于策略学习的生成
Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning
摘要
动作条件世界模型越来越多地用作策略评估与改进的学习型模拟器,但前提是生成的未来能忠实反映任意有效动作。已有基准多局限于专家示范,对非专家动作遵循评估不足。WorldEcho用视觉完整性与SE(3)轨迹对齐检查更广动作分布。诊断发现,现有模型较好复现专家动作,却常在非专家轨迹上忽略指令动作或生成视觉无效的预测轨迹。WorldSync沿三条互补路径改善动作遵循:扩展动作后果的训练分布;通过Action-Forcing Expert使中间视频表征与动作引发的机器人动力学对应;让动作干预下的预测变化与真实未来的相应变化对齐。RoboTwin及真实机器人实验显示WorldSync改善WorldEcho指标,并为迭代策略优化提供更可靠的模拟器,提高策略成功率。