论文
使用大语言模型的空中交通管制:提示工程、架构与评估
Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation
摘要
空中交通管制(ATC)通信是一种安全攸关的对话,尽管空中交通管理的其他部分已实现半自动化,它在很大程度上仍由人工驱动。本文实验性地评估大语言模型(LLM)能否生成操作上符合现实的ATC通话。一架沿旧金山“Bay Tour”航线飞行的实验性通用航空航班被人工转录并用作真值(P0)。通过飞行员在环的流程,我们设计了五种约束递增的提示结构(P1-P5),并将其嵌入一个有状态的多轮流水线:模型扮演ATC,面对固定的飞行员转录文本,同时以不断累积的对话历史为条件。在九个开源与闭源LLM上,我们变化提示、是否提供来自另一实验航班的已处理转录作为上下文示例,以及模型是以自身先前的回复还是注入的真值历史为条件。轮次用词汇、结构和语义相似度指标打分,并用经人类专家标注验证的LLM评审(GPT-5.5)打分。提供已处理的示例能提升相似度,但收紧提示则不能:最轻量的提示表现最好,而脚本最重的提示随着自身错误在对话中累积而崩溃,注入正确历史可以修复这一崩溃。这些结果为LLM辅助ATC勾勒出一条具体路径及其当前局限。
