论文

AeroCopilotBench:在交互式虚拟驾驶舱中评测航空副驾驶Agent

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)Agent可能帮助机组进行复杂决策和任务执行,但以静态知识为中心的现有航空评测,无法系统检验交互环境中的程序执行与安全合规。本文提出可复现的交互式虚拟驾驶舱测试环境AeroCopilot Operational Environment(ACOE),以及两层航空Agent评测基准AeroCopilotBench。第一层通过1,200道选择题评估航空知识;第二层包含73项应急和异常任务,来源于制造商的飞行员操作手册(POH),并在ACOE中实现。ACOE将自然语言程序转化为可执行状态转移、终态目标条件和硬性安全约束,使模型能通过标准工具接口理解驾驶舱状态、诊断故障并操作飞机系统。我们建立安全门控评测框架:只有在完成全部任务目标且未违反任何硬性安全约束时,轨迹才算成功;安全目标进展与轨迹安全性另行度量。在12个模型中,第二层最高成功率为72.6%,静态知识表现并不能稳定转化为程序执行能力。对三个代表性模型的451个失败回合的分析发现,程序完整性、状态反馈使用和长程执行管理存在反复出现的失败。这些结果提示,应采用感知状态的Agent编排、联合评估任务完成与轨迹安全,并进行重复回归测试。ACOE和AeroCopilotBench为航空Agent的知识应用、交互执行和运行安全测试提供可复现基础。

AeroCopilotBench:在可执行驾驶舱中对LLM智能体飞机应急程序的安全门控评估:论文配图
图1:AeroCopilotBench 概览。左:用于构建基准的 FAA/CFR 文档和制造商的《飞行员操作手册》(POH)。右上:Tier-1 从权威语料库生成、审查并冻结 1,200 道多项选择题。右下:Tier-2 将 POH 中的应急与异常程序转化为 73 个交互式 ACOE 任务。两个层级分别评估航空知识掌握与依赖状态的安全程序执行。