论文

DriveSafe:驾驶场景中的风险检测和安全建议框架

DriveSafe: A Framework for Risk Detection and Safety Suggestions in Driving Scenarios

应用与实践行业应用

摘要

全面的态势感知对于在安全关键环境中运行的自动驾驶汽车至关重要,因为它可以识别和缓解潜在风险。尽管最近的多模态 大语言模型 (MLLM) 在一般视觉语言任务上表现出了希望,但我们的研究结果表明,与细粒度、基于空间的风险评估中的特定领域方法相比,零样本 MLLM 的表现仍然不佳。为了解决这一差距,我们提出了 DriveSafe,这是一个利用结构化自然语言描述的风险感知场景理解框架。具体来说,我们的方法首先生成富含多模态上下文的空间空间定位字幕,包括运动、空间和深度线索。然后,这些标题用于下游风险评估,明确识别危险物体、其位置以及它们暗示的不安全行为,然后提出可行的安全建议。为了进一步提高性能,我们采用标题风险配对来微调轻量级适配器模块,从而有效地将特定领域的知识注入基础 LLM 中。通过对基于语言的显式场景表示进行风险评估,DriveSafe 比零样本 MLLM 和先前的特定领域基线取得了显着的进步。 DRAMA 基准的详尽实验证明了最先进的性能,而消融研究则验证了我们关键设计选择的有效性。项目页面:https://cvit.iiit.ac.in/research/projects/cvit-projects/drivesafe