论文
PilotBench:面向安全约束下通用航空智能体的基准
PilotBench: A Benchmark for General Aviation Agents with Safety Constraints
摘要
随着大语言模型(Large Language Models, LLM)向在物理环境中运行的具身AI智能体迈进,一个根本性问题浮现出来:在文本语料上训练的模型能否在遵守安全约束的同时,对复杂物理进行可靠推理?我们通过PilotBench来回答这一问题——这是一个评估LLM在安全关键飞行轨迹与姿态预测上能力的基准。PilotBench由708条真实世界的通用航空轨迹构建而成,横跨九个运行上各不相同的飞行阶段,并配有同步的34通道遥测数据;它通过对LLM与传统预测器的对比分析,系统性地探测语义理解与受物理支配的预测的交汇之处。我们提出综合指标Pilot-Score,以60%的回归准确率与40%的指令遵循及安全合规进行平衡。对41个模型的对比评估揭示了一种“精度-可控性二分法”:传统预测器取得了更优的MAE(平均绝对误差)7.01,但缺乏语义推理能力;而LLM以86-89%的指令遵循率换来了可控性,代价是11-14的MAE精度。分阶段分析进一步暴露出“动态复杂度鸿沟”——LLM在Climb(爬升)与Approach(进近)等高负载阶段性能急剧下降,暗示其隐式物理模型是脆弱的。这些实证发现激发了对混合架构的探索,即将LLM的符号推理与专用预测器的数值精度相结合。PilotBench为在安全受约束领域推进具身AI提供了严谨的基础。
