论文

超越语义准确性:安全关键语言理解的后果感知评估

Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

模型评测评测方法与指标

摘要

语言模型在安全关键操作中是否可信?在这种情况下,语义指标的强大性能并不能保证操作的可靠性:误读高度、执行条件下降或混乱的呼号可能在标准 F1 下得分很高,但会带来严重不对称的操作后果。我们在空中交通管制(ATC)中研究这个问题,其中管制员与飞行员的通信要求接近零的容错性,并使用后果感知评估来测试语义分数是否误述了运行可靠性。该框架在受控诊断 ATC 基准​​中实例化,该基准基于航空标准和三个国家 40 名空中交通管制员的反馈。通过评估 8 个模型,我们发现了一个系统性的语义安全差距:即使对于在标准指标下看起来可靠的模型,传统分数给出的性能估计也比结果感知评估高得多。风险意识 微调 缩小了但没有消除这一差距,表明在任何真正的安全关键部署声明之前,结果意识评估是标准 NLP 指标的必要补充