论文

DEXTERA:从单一图像到通过真实到模拟到真实的可部署灵巧操作

DEXTERA: From a Single Image to Deployable Dexterous Manipulation via Real-to-Sim-to-Real

模型训练合成数据

摘要

收集现实世界的机器人数据以进行灵巧的操作既昂贵又耗时。虽然高保真物理模拟器可以实现可扩展的数据合成和策略学习,但手动构建可部署的数字孪生仍然是劳动密集型的,并且残留的视觉、几何和动态差距阻碍了可靠的模拟到真实的传输。我们提出了 DEXTERA,一个自动化的真实到模拟到真实的框架,它将单个 RGB 图像转换为可部署的策略,以便在四个统一阶段进行灵巧操作:(1)将单图像场景分解为静态高斯背景和具有 VLM 推断的物理参数的交互式刚性或铰接资产; (2) 度量场景全局对齐、对象标准化和形态平衡机器人标定; (3)可扩展模拟器任务原语构建、VR远程操作和以对象为中心的轨迹合成; (4)支持模仿学习和强化学习的共享多模式政策界面。我们通过 13 个任务实施对、2 个灵巧机器人平台和 6 个策略架构来评估 DEXTERA。实验结果表明,与生成基线相比,DEXTERA 实现了卓越的视觉保真度和 3D 几何重建,而跨域轨迹回放则验证了强大的物理交互一致性。此外,仅进行模拟训练的策略可实现可行的零射击真实机器人部署,而模拟与真实协同训练则可将不同策略架构的平均物理策略成功率从 29.2% 大幅提高到 61.9%。