论文

dWorldEval:通过离散扩散世界模型进行可扩展的机器人政策评估

dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model

模型评测评测方法与指标

摘要

使用现有方法评估数千个环境和数千个任务的机器人策略是不可行的。这激发了对可扩展机器人政策评估的新方法的需求。在本文中,我们提出了 dWorldEval,它使用离散扩散世界模型作为机器人策略的可扩展评估代理。具体来说,dWorldEval 将所有模态(包括视觉、语言和机器人动作)映射到统一的词元空间中,并通过单个基于 Transformer 的去噪网络对它们进行建模。在本文中,我们提出 dWorldEval,使用离散扩散世界模型作为机器人政策的可扩展评估代理。具体来说,它将所有模式(包括视觉、语言和机器人动作)映射到统一的标记空间中,然后使用单个 Transformer 网络对它们进行去噪。在此架构的基础上,我们采用稀疏关键帧内存来保持时空一致性。我们还引入了一个进度标记来指示任务完成的程度。在推理时,该模型联合预测未来的观察结果和进度标记,允许在进度达到 1 时自动确定成功。大量实验表明,dWorldEval 在 LIBERO、RoboTwin 和多个真实机器人任务上显着优于以前的方法,即 WorldEval、Ctrl-World 和 WorldGym。它为构建用于大规模机器人评估的世界模拟器的新架构范例铺平了道路。