发出警报之前先观察:使用视觉语言模型进行自适应驾驶员警报
Observe Before You Alert: Adaptive Driver Alerting with Vision-Language Models
摘要
通过行车记录仪视频向驾驶员发出警报需要在部分可观察性下做出连续决策:系统不仅必须决定场景是否有风险,而且还必须决定何时证据足以发出警告。大多数现有的事故预测模型都会输出二元风险评分,从而将模糊的场景留给阈值处理。我们提出了 VLAlert,一种视觉语言警报框架,它将警告生成作为针对“沉默”、“观察”和“警报”的三重行动策略。观察操作充当内部证据收集决策,延迟不确定的警告并更改下一个观察窗口,从而为自适应警报创建轻量级的感知-操作循环。 VLAlert 使用 Qwen3-VL-4B 作为安全证据生成器,并从结构化置信跨度中汇集隐藏状态,形成用于危险估计和策略预测的紧凑表示。我们在 VLAlert-Bench 上评估 VLAlert,VLAlert-Bench 是来自四个真实行车记录仪警报数据集的统一每滴答基准,并进一步测试转移到保留的自然 ADAS 接管剪辑。在 VLAlert-Bench 验证中,VLAlert 在测试的基线中实现了最高的面向部署的效用,DAUS 为 0.4878,而 Open-BADAS 为 0.4752,并将 AUROC、AP_tick、F1_t 和平衡精度从 0.610、0.176、0.276 和 0.581 提高到 0.689、0.195,分别为 0.297 和 0.648。在 221 个保留的 ADAS-TO-Critic 剪辑中,VLAlert 将 R@5s 从 74.2% 提高到 88.7%,将 F1 从 0.585 提高到 0.686。这些结果表明,自适应观察和注重安全的 VLM 表示为面向驾驶员的警报决策提供了可衡量的收益。