论文
迈向可审计且经校准的失智相关事故严重度预测AI:支持人工审查的选择性转交框架
Toward Auditable and Calibrated AI for Dementia-Related Crash Severity Prediction: A Selective Deferral Framework to Support Human Review
摘要
公共事故数据库日益支撑自动化安全分析,但当模型主要作为普通分类器评估时,事故严重度预测仍难以转化为公共部门决策工作流。本研究将失智相关事故严重度建模重构为决策感知的分诊问题:系统须将事故分为无伤/仅财产损失(O)、轻伤或中度伤(BC)与致命或重伤(KA),同时控制结果泄漏、报告严重的分诊不足、校准置信度,并保留每一条原始预测以供审计。使用4781条含结构化字段与警方叙述的得州事故记录,我们在分层70/15/15划分下评估结构化、叙述、融合、校准融合、BERT家族与本地大语言模型基线。在所报告划分中,泄漏控制的Gemma取得最高观测macro-F1(0.545;95%自助CI [0.507, 0.583])。最佳校准融合模型macro-F1为0.522、期望校准误差为0.033。选择性转交提升了保留给自动分类案例的表现:70%覆盖率下macro-F1升至0.573、严重度成本降至0.577,而被转交案例被视为拟议人工审查流程的候选,未在本实验中进一步评估。本研究贡献了一个可复现、泄漏受控且不确定度感知的事故AI评估框架,强调可审计性与选择性转交而非单纯准确率。
