论文
STAR-VLM:通过汽车雷达监督进行运动和速度估计的时空定位视觉语言模型
STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision
摘要
视觉语言模型(VLM)正在成为体现智能的关键组成部分,在自动标签和端到端自动驾驶方面的应用不断增长。然而,现有的改进 VLM 时空推理的方法通常依赖于复杂的预处理流程、昂贵的人工注释或合成数据,这限制了可扩展性并引入了潜在的模拟与真实的差距。此外,尽管这些方法提高了时空理解,但它们仍然缺乏针对动态场景的强大度量推理能力,例如以现实世界单位估计对象运动。先前的工作已经探索了基于激光雷达的度量深度监督来增强空间感知,但它并没有直接解决时间推理。我们推出了 STAR-VLM,这是一种汽车雷达监督框架,可通过运动推理和度量速度估计来增强自动驾驶的时空 VLM。汽车雷达是一种低成本且广泛部署的传感器,可通过距离和多普勒测量提供补充时空监督。通过在训练期间利用这些测量作为无标签 真值,STAR-VLM 提高了 VLM 的度量时空推理能力。通过驾驶场景的实验,我们表明 STAR-VLM 在运动分类和度量速度估计方面均实现了最先进的性能,甚至优于为每个任务设计的特定任务方法。这些结果凸显了汽车雷达作为一种可扩展且经济高效的监管来源,可用于为现实世界的自动驾驶构建度量感知的时空 VLM。