论文
微调 大语言模型 用于小型无人机系统的协同战术冲突消解消除
Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems
摘要
小型无人机系统 (sUAS) 在低空空域的部署不断增加,增加了在安全关键约束下可靠战术消除冲突的需求。战术冲突消解涉及在密集、部分可观察和异构多智能体环境中进行短期决策,必须保持合作分离保证和运行效率。虽然大语言模型(LLM)表现出强大的推理能力,但它们在空中交通管制中的直接应用仍然受到领域知识依据不足和不可预测的输出不一致的限制。本文研究了 LLM 作为决策者在协作多智能体战术冲突消解中的作用,使用 微调 策略将模型输出与人类操作员启发式相匹配。我们提出了一种基于 BlueSky 空中交通模拟器的模拟到语言数据生成管道,该管道可生成反映既定安全实践的规则一致的冲突消除数据集。预训练的 Qwen-Math-7B 模型使用两种参数高效策略进行微调:具有低秩适应 (LoRA) 的监督 微调 以及将 LoRA 与组相对策略优化 (GRPO) 相结合的基于偏好的 微调。验证数据集和闭环模拟的实验结果表明,与预训练的 LLM 相比,有监督的 LoRA 微调 显着提高了决策准确性、一致性和分离性能,并且显着减少了近空中碰撞。 GRPO 提供了额外的协调优势,但在与异构代理策略交互时表现出稳健性降低。