论文
AeroCopilotBench:在交互式虚拟驾驶舱中评测航空副驾驶Agent
AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment
摘要
大语言模型(LLM)Agent可能帮助机组进行复杂决策和任务执行,但以静态知识为中心的现有航空评测,无法系统检验交互环境中的程序执行与安全合规。本文提出可复现的交互式虚拟驾驶舱测试环境AeroCopilot Operational Environment(ACOE),以及两层航空Agent评测基准AeroCopilotBench。第一层通过1,200道选择题评估航空知识;第二层包含73项应急和异常任务,来源于制造商的飞行员操作手册(POH),并在ACOE中实现。ACOE将自然语言程序转化为可执行状态转移、终态目标条件和硬性安全约束,使模型能通过标准工具接口理解驾驶舱状态、诊断故障并操作飞机系统。我们建立安全门控评测框架:只有在完成全部任务目标且未违反任何硬性安全约束时,轨迹才算成功;安全目标进展与轨迹安全性另行度量。在12个模型中,第二层最高成功率为72.6%,静态知识表现并不能稳定转化为程序执行能力。对三个代表性模型的451个失败回合的分析发现,程序完整性、状态反馈使用和长程执行管理存在反复出现的失败。这些结果提示,应采用感知状态的Agent编排、联合评估任务完成与轨迹安全,并进行重复回归测试。ACOE和AeroCopilotBench为航空Agent的知识应用、交互执行和运行安全测试提供可复现基础。
