论文

Radar4D-VLM:跨冻结语言模型的基于提案的时态 4D 雷达推理

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

应用与实践视觉感知与空间理解

摘要

自动驾驶的视觉语言模型主要依赖于摄像头和激光雷达,而 4D 雷达作为一种独立的感知方式在很大程度上尚未得到探索,尽管它对不利能见度和直接测量径向速度具有鲁棒性。我们推出了 Radar4D-VLM,这是一种仅雷达时间视觉语言模型,可以在没有相机或 LiDAR 输入的情况下从十个连续 4D 雷达点云扫描中进行推理。 Radar4D-VLM 提取几何基础的对象建议,并将雷达证据组织成对象、场景和运动学标记的紧凑层次结构。参数高效的投影仪将这些标记映射到冻结的语言主干中,而可审计的预测头则联合对对象计数、空间分布、运动状态、碰撞风险、语义类别和径向速度进行建模。 Radar4D-VLM 在统一的冻结骨干接口中结合了基于提议的时间对象标记化、全局场景上下文和显式运动学标记。在序列隔离的 K-Radar 开发验证中,其 Top-64 建议召回率在 4 m 处达到 98.13%,分别超出固定格子和均匀随机控制 6.40 个和 22.83 个百分点。我们在相同的适应预算下进一步评估了跨越 8 个冻结的 Qwen、Phi、Mistral、Llama 和 Gemma 主干的 24 次匹配运行。雷达词元接口在所有五种语言模型系列中保持兼容,而匹配的对​​齐、排列和无语言控制显示了传感器依赖性,但没有从对齐的语言监督中获得稳定的直接头部增益。这些结果为仅雷达的多模态场景和运动推理奠定了可重复的基础,同时将接口兼容性与语言监督的好处分开。