论文

空中交通管制语言理解系统的安全评估

Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

模型评测评测方法与指标

摘要

空中交通管制 (ATC) 是一个安全关键领域,对指令的错误解释可能会导致严重的操作后果。虽然 大语言模型 (LLM) 表现出强大的总体性能,但其在 ATC 运行环境中的可靠性仍不清楚。现有的评估方法主要基于 F1 或宏观准确性等聚合指标,统一处理所有错误,并且无法考虑高风险语义错误(例如不正确的跑道标识符或运动限制)的不对称后果。为了弥补这一差距,我们提出了一个针对 ATC 运营的、以安全为导向、具有后果意识的评估框架。我们的结果表明,虽然当前的 LLM 实现了合理的聚合精度,但其运行可靠性受到严重限制。根据干净的成绩单进行评估,风险得分峰值仅为 0.69,尽管宏观 F1 性能很高,但大多数模型得分低于 0.6。进一步的分析表明,尽管行动类型分类相对稳定,但错误集中在高影响力的实体中,这表明结构性基础缺陷。这些发现强调了后果意识评估协议对于负责任地部署人工智能辅助空中交通管制系统的必要性。