论文

R3D:重新审视 3D 政策学习

R3D: Revisiting 3D Policy Learning

模型架构混合架构

摘要

3D 策略学习有望实现卓越的泛化和跨实体迁移,但训练不稳定和严重过度拟合阻碍了进展,阻碍了强大的 3D 感知模型的采用。在这项工作中,我们系统地诊断了这些故障,将 3D 数据增强的遗漏和批量归一化的不利影响确定为主要原因。我们提出了一种新架构,将基于 Transformer 的可扩展 3D 编码器与扩散解码器相结合,专门针对大规模稳定性而设计,并旨在利用大规模 预训练。我们的方法在具有挑战性的操纵基准上显着优于最先进的 3D 基准,为可扩展的 3D 模仿学习奠定了新的、强大的基础。项目页面:https://r3d-policy.github.io/