论文
MoRAL:紧凑型 VLM 的基于传感器的 BEV 推理,实现面向边缘的自动驾驶
MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
摘要
在资源受限的自动驾驶平台上部署视觉语言模型 (VLM) 以进行安全关键的空间推理,需要紧凑的模型大小和可靠的度量基础。我们提出了 MoRAL(自主语言模型的多模态推理),这是一个两阶段的 微调 管道,它教会 Cosmos-Reason2-2B 首先读取物理编码的鸟瞰图 (BEV) 表示,然后对其进行推理以做出决策。 BEV 图像将 LiDAR 度量距离编码为色带,将对象类别编码为簇形态,将雷达多普勒速度编码为定向楔形叠加,将空间感知外化到输入图像中,以便在推理时不需要学习 3D 主干。第一阶段根据 60,000 个空间对齐记录对视觉编码器进行微调;零样本基线不会产生可解析的 BEV 输出,确认词汇需要显式训练。第 2 阶段根据 Cosmos-Reason2-8B 作为教师生成的 57,696 条思维链记录对完整模型(5200 万个参数,占总数的 2.4%)进行微调,涵盖八种驾驶问题类型。在 Gemma 4 (31B) 评估的 2,304 个保留的 nuScenes 帧中,根据人工审核进行校准,尽管使用的参数少了四倍,但 MoRAL 在零样本 8B 基线上赢得了 8 种问题类型中的 7 种,其中需要结构化多步骤物理推理的问题类型的优势最大。紧急制动召回率从 10.8% 提高到 47.8%,输出退化从 94.1% 下降到 20.8%,整个管道适合消费类 8 GB GPU,速度为 42 tok/s,无需量化。这些结果为移动边缘平台上紧凑的、基于物理的 VLM 推理奠定了可重复的基础。