论文

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

模型训练合成数据

摘要

大规模预训练视觉语言动作模型的最新进展改善了机器人策略学习,但由于泛化能力有限,在特定于用户的环境中直接部署此类策略仍然具有挑战性,这不可避免地需要收集适合目标环境的数据集。远程操作可以产生一致的数据,但成本高昂且难以扩展,而模拟可以轻松扩展,但难以模拟目标环境并生成特定于任务的轨迹。为了同时满足这两个要求,我们提出了 PRISM,这是一种端到端管道,可以从单个图像和自然语言指令生成个性化机器人数据集。 PRISM 构建在语义和几何上与用户环境一致但在实例级别上多样化的数字表亲场景,并在无需人工远程操作的情况下合成可执行演示。大量实验表明,在 PRISM 生成的数据集上训练的策略优于在 LIBERO 和 LIBERO-Plus 上基线生成的数据集上训练的策略,在三个现实世界操作任务中实现高达 100% 的成功率,并且在与训练期间不同的环境中进行评估时保持更强的性能。