论文

使用警方事故叙述对 Frontier 大语言模型 与官方事故数据库编码进行基准测试

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

模型评测模型能力评测

摘要

警方的事故叙述包含可以补充结构化事故数据库的信息,但手动审查是劳动密集型的,而且目前还不清楚 大语言模型 (LLM) 再现官方事故编码的效果如何。本研究通过将叙述性派生的碰撞属性代码与阿肯色州致命碰撞数据库中的相应字段进行比较,对六个前沿 LLM 进行了基准测试。该分析将阿肯色州(2015 年至 2025 年)的 5,587 起致命事故叙述与 5,889 条结构化事故记录联系起来,得出 4,194 起匹配事故。使用相同的零样本提示对六个 LLM 进行了评估,以编码碰撞方式、非驾驶者关系、交叉口类型、工作区关系、道路表面状况和光照条件。使用一致性、宏观平均 F1 分数、Cohen's kappa、覆盖率、选择性一致性以及与始终多数、始终未知和关键字规则基线的比较来评估性能。重复测量分析和广义估计方程模型评估了模型和属性之间的差异。 GPT-5.5 High 在评估的 LLM 中实现了最高一致性,但始终多数基线产生了更高的原始一致性,关键字规则基线实现了宏观平均 F1 分数和 Cohen kappa,与表现最佳的 LLM 相当。非驾驶者关系和碰撞方式的一致性最高,而光照条件、路面状况和工作区关系的一致性最低。碰撞属性之间的差异超过了模型之间的差异。这些结果为评估基于 LLM 的崩溃编码提供了基准,并表明应使用透明基线和人工审查在特定于属性的基础上评估部署。