论文

OSCAR:机器人的全方位动作条件世界模型

OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics

摘要

我们提出了 OSCAR,一种精确的动作条件视频世界模型,它可以概括不同的机器人实施例并实现机器人策略评估。现有的视频世界模型在现实世界的机器人评估中面临三个主要挑战:当前机器人训练数据集中的场景多样性有限、动作跟随不精确以及跨实施例的泛化能力较差,无法广泛采用。我们从两个角度应对这些挑战。其核心是一个大规模的标准化数据管道,可以对广泛的机器人和以自我为中心的人类数据集进行管理、过滤和重复数据删除,从而产生一个跨越不同任务、场景、动作和机器人实施例的干净的联合训练数据集。为了调节视频模型,我们采用 2D 运动学骨架渲染作为统一的调节表示,可以推广到不同的机器人手臂甚至人手。我们在单个 GH200 GPU 上微调 Cosmos-Predict2.5-2B 模型。与现有基线相比,我们的模型在动作跟踪、外观质量和运动一致性方面取得了显着改进,现有基线要么具有更大的模型尺寸,要么需要更多 GPU。我们进一步部署 OSCAR 来评估 RoboArena 的机器人策略。大量实验证明了我们在 OSCAR 中的虚拟策略评估与现实世界评估之间的显着相关性,为未来可以在虚拟生成的世界中纯粹评估机器人策略铺平了道路。