论文

VOLA:通过基于 VLM 的语义属性预测改进开放世界驾驶

VOLA: Improving Open-World Driving by VLM-Based Semantic Attribute Prediction

应用与实践行业应用

摘要

现实世界中的驾驶是开放世界:汽车可能会遇到掉落的床垫、鹿或训练数据之外的其他物体。仅仅命名它们是不够的。系统必须知道如何处理每个区域:它是否可以驶过该区域,以及碰撞会有多严重?因此,我们将场景感知从类别标签转移到密集的动作相关属性,其中每个像素都根据它如何影响运动而不是对象名称来标记。我们用两个有序属性来实例化这个通用公式:7 阶驾驶性和 5 阶脆弱性。我们直接将 Qwen3.5 图像词元隐藏状态读取为空间语义表示。然后,轻量级边界感知解码器将这个粗略的标记网格转换为清晰的全分辨率属性图。整个过程既不需要自回归文本生成,也不需要外部掩模模型(例如 SAM)。我们在 CARLA 中内置的密集属性标签上进行训练,并测试迁移到真实场景和训练中从未见过的新障碍。我们与接受相同属性训练的纯视觉分割器和提示 VLM 分割器进行比较。我们的模型在熟悉的类别上匹配强大的仅视觉分段器,并改进了到真实开放世界异常的转移,平均漏洞排名召回率达到 69.4%,而最佳仅视觉基线为 57.1%,最佳提示 VLM 基线为 53.9%。这些结果表明,VLM 图像标记为将驾驶属性转移到训练词汇表之外的对象提供了有用的语义线索。