论文
经多任务风险融合的LLM生成驾驶员干预消息安全感知评估
Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion
摘要
既有驾驶员干预系统依赖听觉警报与固定模板——未能利用多任务识别输出。BLEU与BERTScore等通用指标无法捕捉干预特定质量维度——包括风险-紧迫度对齐、认知负荷与驾驶员可接受性。本文提出驾驶员安全感知干预分数(DSAIS)——领域特定指标:经轻量规则计算与LLM裁判评估结合的混合架构评估五个维度——连同端到端框架:经风险融合、状态历史管理与动态提示构造把四任务识别输出集成进LLM。在AIDE数据集上五模型七条件的实验表明:DSAIS跨三个架构不同的裁判取得ICC 0.798-0.840、跨全部对照条件Cohen's d>1.5。多维子分数分析量化了规则系统与LLM系统间的情境适应性差距——揭示多任务集成较规则基线提升情境相关性9.1%。消融实验证明各框架组件都贡献情境相关性——子分数分解揭示聚合评分掩盖的增益。驾驶员情绪识别被确认为最关键的上游因素——且紧凑本地LLM(7B-9B参数)取得优于API模型的质量——为车载部署提供实用设计指南。
