论文
Pre-Flight:评估LLM航空运营知识的基准
Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge
摘要
大语言模型(LLM)日益被提议用于航空业务运营——从文档与训练生成到面向客户的助手。通用基准无法衡量模型是否对航空特定运行知识安全正确地推理——而该领域的高风险、受监管性质使该缺口后果严重。我们提出Pre-Flight——开源基准——300道多选题取材于国际标准与机场地面运行材料——覆盖国际机场地面运行、ICAO与US FAA法规、航空通用知识与复杂运行场景。题目由具有空中交通管理、地面运行与商业飞行经验的从业者编写并审查。我们使用Inspect评估框架评估一系列当代商业与开放权重模型——按标准多选协议以准确率评分——并随新模型发布滚动维护排行榜。对照在会议上对航空专业人士低样本测验获得的约95%非正式专家参照——即使所评估的最强模型(2026年发布)也仅达82.7%——从2025年初的约75%仅缓慢提升。因此低于专家级可靠性的显著持续差距仍然存在。我们发布数据集、评估工具与结果——该基准在inspect_evals随附的社区评估包中可用。我们主张此类领域特定评估是在非安全攸关航空运营中负责任部署生成式AI的必要前提。