论文
TerraTransfer:无需专家演示即可学习端到端驾驶策略
TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations
摘要
端到端自动驾驶在基准测试和实际部署中实现了最先进的性能。然而,它的标准训练方法在所有阶段都很昂贵:收集和标记数百万个驾驶帧的成本很高,并且图像上的闭环强化学习受到照片级真实感渲染的每步成本加上通过大型视觉主干的前向传递的瓶颈。矢量化模拟器中的自玩改变了经济性:每秒数百万个轨迹采样步,以及自然富含碰撞、未遂事件和恢复的状态分布,而驾驶日志中没有包含这些内容。我们的方法通过将学习驱动与学习观看分离来利用这种不对称性。我们通过自我对弈来预训练单个策略,然后通过动作 KL 散度和批量关系低秩结构损失将其潜在空间与预训练的视觉主干对齐。动作目标来自自我游戏策略,因此对齐永远不会监督记录的轨迹:(图像、场景状态)帧的配对数据集就足够了,不需要模仿预训练所依赖的策划专家演示。在逼真的 3D 高斯喷溅闭环场景中,生成的端到端策略匹配或超过了先前的端到端方法。