论文

CRISP:用世界模型预测预训练摄像头—雷达驾驶骨干

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

模型训练预训练

摘要

摄像头雷达(CR)融合是自动驾驶的一种实用传感配置,但现有模型通常是通过特定于任务的监督进行训练的,限制了可重复使用的表示学习。我们提出了 CRISP,一种通过基于预测的表示学习进行预训练的时空 CR 主干。给定历史多视图图像和雷达扫描,CRISP 通过预测未来 LiDAR 点云来学习统一的鸟瞰图 (BEV) 表示。 LiDAR仅在预训练期间用作特权监督;部署的模型只需要摄像头和雷达。为了使基于预测的预训练对 CR 融合有效,CRISP 引入了增强型雷达编码器、雷达增强型时间自注意力以及具有模态创新门控的多模态特征渲染。这些组件将雷达范围和多普勒线索注入 BEV 时间传播中,并允许 BEV 词元有选择地合并摄像头和雷达证据。 nuScenes 上的实验表明,CRISP 改进了长视野点云预测,并有效地转移到下游任务,包括 3D 检测、跟踪、在线地图、运动预测、未来占用预测和规划,这表明预测 CR 预训练是在实际传感器配置下实现可扩展驾驶表示的一条有前途的途径。项目网站为https://umfieldrobotics.github.io/CRISP。