论文
大规模校准决策:使用 System One 模型将警察事故叙述转换为概率事故变量 (Jev)
Calibrated Decisions at Scale: Converting Police Crash Narratives into Probabilistic Crash Variables with a System One Model (Jev)
摘要
带有调查员叙述的崩溃数据集包含编码字段省略的信息。大规模编码这些叙述受到三个障碍的阻碍。前沿大型语言模型在这种规模下成本高昂,它们生成的文本无法验证,并且没有规则规定人类必须检查多少输出。本文将叙述性编码表述为由 Jev 回答的门控、类型化决策,Jev 是一个 System One 模型,它返回分析师定义的选项的概率并且不生成任何文本。一个屏幕涵盖了 499,500 个德克萨斯州的叙述,其中 195,857 个故事是用 27 个问题的模式编码的。成本由模式大小而不是叙述长度决定。概率根据编码字段和根据规定的抽样设计得出的 2,416 个盲人判断进行审核。两个前沿大语言模型在相同的记录上进行了基准测试。相对于人类标签,类型化模型的 F1 为 0.908。一个前沿模型获得了 0.059,而另一个则与之没有区别。校准因模型而不是范例而异,因此每个模型都必须经过审核。对相同标签进行重新校准可将校准误差减少 3.3 倍。与编码字段的一致性低估了对叙述的保真度,kappa 的中位数为 0.26。分辨率下限范围涵盖在离散网格上报告概率的任何模型。对标记记录的审查预算给出了人们必须按变量和每年阅读的记录。将校准变量添加到编码字段中,每年因九个因素造成的伤害和致命事故增加了 10,747 起。