论文
驾驶员监控系统的视觉语言模型:驾驶员活动描述数据集
Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset
摘要
了解微妙的驾驶员行为对于构建可靠的驾驶员监控系统至关重要。现有的视觉语言模型 (VLM) 是在通用数据集上进行训练的,很难识别驾驶员行为的细微差别。本文通过创建 Drive&Act 数据集的详细自然语言版本来解决此限制。我们使用基于 LLM 的评分方法在新基准上评估三个 VLM。他们在新基准上的表现表明他们无法可靠地生成准确的细粒度驾驶员活动描述。基于标记的 Drive&Act 数据集,我们创建了一个新的 Drive&Act 描述数据集,其中包含细粒度的描述,以训练 VLM 理解驾驶员活动。对驾驶员监控数据集 (DMD) 的跨数据集评估表明,在我们新的 Drive&Act 描述数据集上微调的 VLM 可以很好地推广到 DMD 数据集中的操作。在我们的 Drive&Act 描述数据集上进行微调的 VLM 获得了 76 分的 ACCR 分数,优于零样本 VLM 基线(ACCR 分数为 66 分)。这些发现表明,采用丰富描述的驾驶员动作来调整 VLM 可以显着提高其解释驾驶员行为的能力,同时也强调需要更多样化的数据集来支持未来应用中更广泛的泛化。我们的 Drive&Act 描述数据集和代码将在 GitHub 上公开提供。