论文
DreamTrue:具有反事实训练后的忠实行动机器人世界模型
DreamTrue: Action-Faithful Robot World Model with Counterfactual Post-Training
摘要
我们提出了 DreamTrue,一种多视图、跨实体的机器人世界模型,用于忠实于动作且物理上合理的视频预测。在现有的机器人数据集上训练这样的模型面临两个障碍:不精确的校准可能会损害行动跟踪,而对不成功交互的有限覆盖可能会使预测偏向于成功的结果。为了改进跨实施例的动作跟踪,我们将动作轨迹渲染到图像空间条件中,并引入离线几何校准以使这些条件与目标视频对齐。为了扩大交互覆盖范围,我们引入了反事实后训练,修改记录的动作轨迹并在更广泛的动作和接触配置下生成未来视频。为了在没有配对真实未来的情况下提供对这些预测的反馈,我们构建了一个涵盖机器人、物体和交互缺陷的人工注释视频数据集,并用它来训练具体视频奖励模型。它的分数指导强化学习训练后获得更物理上合理的交互结果。在 AgiBot、DreamTrue 实现了最先进的动作跟踪,同时将人类评估的交互缺陷率从 48.12% 降低到 6.25%。值得注意的是,我们的模型在2026年AgiBot世界挑战赛的世界模型赛道中排名第一。项目页面可以在https://brave-eai.github.io/DreamTrue.找到