论文

AeroEval:分阶段验证AI生成无人机程序与执行结果

AeroEval: Staged Program and Execution Validation for AI-Generated Drone Missions

智能体系统应用与实践Agent 动作执行与治理Agent Harness机器人

摘要

大型语言模型 (LLM) 可以根据自然语言任务描述生成无人机程序,但语法上有效的程序仍然可能违反用户意图、环境约束和任务级行为。这个问题在网络物理应用中很明显,其中正确性取决于生成的代码、移动传感、环境几何、事件驱动分析和物理执行之间的交互。现有的无人机代码生成系统主要使用提示护栏或模拟器结果,并提供有限的故障定位。我们推出了 AeroEval,这是一种Agent辅助中间件,用于对人工智能生成的无人机任务进行分阶段验证。 AeroEval 将确定性程序分析与基于上下文的 LLM Agent相结合。它首先验证程序语法、平台 API 使用和任务意图,然后使用执行轨迹、任务要求和环境上下文评估已实现的行为。每个阶段都会返回结构化的故障信息以进行迭代再生。在我们的评估中,使用了 20 个导航任务和 5 个分析任务 与 AirSim 和 Gazebo 模拟器相比,AeroEval 将导航成功率从 55% 提高到 95%。在分阶段消融研究中,我们的代码和轨迹验证器本身分别实现了 44% 和 56% 的平均运行级成功率,而完整的 AeroEval 管道达到了 88%;这些阶段会检测程序结构、API 使用、任务意图、避障、高度、覆盖范围和事件驱动转换中的互补故障,并由引导再生进行纠正。在主要分析任务中,AeroEval 将总体运行水平成功率从一次性 AeroGen 的 34% 提高到再生预算内的 88%。这些结果证明了在评估环境中将程序级和基于执行的 Agentic 验证相结合对于 AI 生成的无人机应用程序的好处。