论文
使用多模态的 Ego-View 事故视频中的责任分配估计 大语言模型
Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models
摘要
最近对多模式交通事故理解的研究主要依赖于基础设施摄像机镜头、卫星图像或结构化碰撞记录。然而,此类数据源的大规模部署和维护成本高昂,而且无法客观地捕捉驾驶员在事故发生前实际观察到的情况。相比之下,自我视图事故视频直接代表驾驶员的视觉视角,使其适合推理可避免性和驾驶员责任。在本文中,我们介绍了自我视图交通事故视频的责任分配估计,这是一项新任务,其中模型预测分配给每个相关代理的责任百分比。我们构建了 LLM 辅助的责任注释管道,并在多种输入设置(包括原始帧、分段增强输入和文本描述)下微调多模态 大语言模型。实验结果建立了强大的初始基准,证明多模态 LLM 可以有效地执行这种细致入微、基于约束的推理任务。我们的研究结果表明,以自我为中心的事故视频为超越传统事故分类和解释任务的具有社会和法律意义的多模式推理提供了有希望的基础。