论文

使用大语言模型的空中交通管制:提示工程、架构与评估

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

摘要

空中交通管制(ATC)通信是一种安全攸关的对话,尽管空中交通管理的其他部分已实现半自动化,它在很大程度上仍由人工驱动。本文实验性地评估大语言模型(LLM)能否生成操作上符合现实的ATC通话。一架沿旧金山“Bay Tour”航线飞行的实验性通用航空航班被人工转录并用作真值(P0)。通过飞行员在环的流程,我们设计了五种约束递增的提示结构(P1-P5),并将其嵌入一个有状态的多轮流水线:模型扮演ATC,面对固定的飞行员转录文本,同时以不断累积的对话历史为条件。在九个开源与闭源LLM上,我们变化提示、是否提供来自另一实验航班的已处理转录作为上下文示例,以及模型是以自身先前的回复还是注入的真值历史为条件。轮次用词汇、结构和语义相似度指标打分,并用经人类专家标注验证的LLM评审(GPT-5.5)打分。提供已处理的示例能提升相似度,但收紧提示则不能:最轻量的提示表现最好,而脚本最重的提示随着自身错误在对话中累积而崩溃,注入正确历史可以修复这一崩溃。这些结果为LLM辅助ATC勾勒出一条具体路径及其当前局限。

使用大语言模型的空中交通管制:提示工程、架构与评估:论文配图
图1:总体架构。(1)生成:从一次实验性的湾区观光飞行转录得到的飞行员通话逐轮发送给语言模型,模型以系统提示词和迄今累积的通信历史为条件;每个伪ATC响应被追加回该历史。(2)教师强制生成:同一场景重放,但历史中的管制员一侧被标准答案通话替换。该示例在第24轮对比了两种模式。在以其自身回复为条件时(左),模型陷入了确认循环并回答“Roger”,错过了所需的雷达服务终止与Hayward移交。给定真实历史时(右),同一轮得到了正确的设施、正确的“保持该编码”指令以及正确的频率120.2。(3)评估:每一轮都由自动相似度指标、LLM-as-judge以及在分层子样本上由人类专家进行评分。