论文

通过驾驶员状态世界建模进行风险感知选择性多模式驾驶员监控

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

模型推理测试时计算扩展

摘要

自动驾驶车辆中的持续驾驶员监控需要低延迟推理,同时避免在不确定的驾驶员状态下做出不安全的决策。大型视觉语言模型提供了广泛的多模态先验,但在这种情况下它们的延迟和有限的可靠性使它们不适合作为始终在线的车内监视器。我们提出了一种用于可部署的多模式驾驶员监控的成本感知选择性推理框架。核心系统是一个轻量级 RGB 生理学学生,它将舱内视觉观察与窗口级 HR/EDA 信号相结合,以及一个学习门,决定何时接受快速预测或放弃安全干预。额外的控制表明,学习的分数包含超出先验场景的样本级信息,而精确的生理同步仍然是一个限制。为了整合预测证据,我们进一步研究了一个紧凑的驾驶员状态世界建模模块,该模块推出潜在的驾驶员状态特征并估计未来的快速模型错误和反事实系统级行动成本。在场景诱导的驾驶员需求识别方面,RGB 生理学学生比纯 RGB 和纯生理学基线有所改进,达到 0.7440 Macro-F1 和 0.9099 平衡精度,具有 11.39M 参数和 3.08ms 推理延迟。成本感知选择性推理将种子中不安全的误报从始终快速推理下的 17.37% 减少到大约 5%,同时保持部署级延迟。虽然驾驶员状态世界模型提供了有价值的预测信号,但最差组评估突出了持续的工作点校准漂移。最终,可靠的边缘驱动器监控不仅需要推进感知骨干,还需要推进风险意识选择性控制和群体稳健校准。