论文

STELLAR:扩展 3D 感知大型模型以实现自动驾驶

STELLAR: Scaling 3D Perception Large Models for Autonomous Driving

模型训练预训练

摘要

通过对不同数据集的大规模训练,模型扩展已经取得了显着的成功。由于独特的挑战,例如融合异构传感器数据和复杂的 3D 空间理解的需要,相同的范例是否适用于自动驾驶感知系统仍然是一个悬而未决的问题。为了弥补这一差距,我们提出了一项全面的研究,系统地分析规模对这些系统的影响。我们基于稀疏窗口 Transformer 开发 STELLAR 模型,通过扩展输入模式以包括 LiDAR、雷达、相机和地图先验。我们在包含 5000 万个驾驶示例、多达 5 亿个参数的大规模数据集上训练模型。我们的大规模实验揭示了将模型性能与模型大小、数据和计算联系起来的经验扩展趋势。由此产生的模型在 Waymo 开放数据集挑战中建立了新的最先进技术,大大优于现有技术。我们的工作表明,大规模训练是提高自动驾驶感知模型能力的一条非常有前途的途径。