论文
世界引擎:迈向后训练自动驾驶时代
World Engine: Towards the Era of Post-Training for Autonomous Driving
摘要
自动驾驶车辆必须在现实世界中安全运行,错误可能会造成严重后果。尽管现代端到端驾驶策略在常规场景中表现出色,但其可靠性受到实际驾驶数据集中安全关键“长尾”事件稀缺的限制。这些罕见的相互作用定义了学习策略的实际安全边界,但它们很难在现实世界中大规模收集。在这里,我们表明,这一基本限制可以通过 后训练 预训练的综合高风险交互驾驶模型来解决。我们引入了 World Engine,这是一个生成框架,可以根据现实世界的日志重建高保真交互环境,并系统地将它们推断为现实的安全关键变量。这种范例使基于强化的 后训练 能够将政策与安全约束结合起来,从而规避现实世界探索中固有的物理风险。在基于 nuPlan 构建的公共基准上,World Engine 大大减少了罕见的安全关键场景中的故障,并且比单独扩展 预训练 数据产生了更大的收益。此外,当部署在生产规模的自动驾驶系统上时,由此产生的策略减少了模拟碰撞,并在道路测试中展示了可测量的改进,表明后训练在综合的、安全关键的交互上提供了一条可扩展且有效的途径,以实现更安全的自动驾驶。完整的代码库套件(包括训练)已向公众发布。