论文

PGD​​G:通过单个演示生成稳健的双手策略学习的物理基础数据

PGDG: Physically Grounded Data Generation for Robust Bimanual Policy Learning from a Single Demonstration

模型训练合成数据

摘要

接触丰富的双手操作的行为克隆仍然具有挑战性,因为收集各种演示的成本很高,而且即使很小的干扰也会使系统进入无法进行恢复监督的脱离流形状态。我们提出了 PGDG,一种具有零样本管理的数据生成框架,可将单个演示扩展为物理上合理、成功且多样化的恢复行为的紧凑数据集,而无需额外的人工标记。 PGD​​G 在基于物理的采样器和数据集管理者之间进行迭代,其中管理者选择信息丰富的、非冗余的和可恢复的行为来将采样分布更新为未覆盖的恢复模式,而采样器从这个更新的分布中绘制物理上合理的采样轨迹候选者并保留成功的轨迹。为了进一步提高数据质量,PGDG 采用基于短期抽样的控制,通过纠正措施重新标记选定的风险状态。在四个双手操作任务中,PGDG 在模拟和零样本现实世界转移方面始终优于仅空间增强。在 RotateBox-Pitch 上,模拟成功率从 38% 提高到 93%,现实世界成功率从 35% 提高到 82%。 PGD​​G 还支持有效的基础模型 微调(例如 GR00T),将成功率从 46% 提高到 77%。其他结果可在我们的网站上找到:https://cunxid.github.io/PGDG/。