论文
AgenticDiffusion:基于视觉的无人机导航的基于视图条件的扩散规划的多视图推理
AgenticDiffusion: Multi-View Reasoning with View-Conditioned Diffusion Planning for Vision-Based UAV Navigation
摘要
当导航目标分布在互补的摄像机视图中并且无法从单一视点可靠观察时,基于视觉的无人机导航变得具有挑战性。我们提出了 AgenticDiffusion,一种代理多视图无人机导航框架,它在语义上协调第一人称视图(FPV)和顶视图观察以进行任务级导航。给定自然语言指令,AgenticDiffusion 识别所请求的目标,为每个导航任务选择最合适的摄像机视图,确定相应的导航目标,并调用适当的视图条件扩散规划器来生成轨迹。使用非线性模型预测控制 (NMPC) 执行生成的轨迹。 AgenticDiffusion 在四个真实的室内场景中进行了评估,在 40 次物理飞行试验中实现了 80% 的总体任务成功率。在混合可见度场景中,所请求的目标分布在 FPV 和顶视图观测中,协调多视图导航相对于仅 FPV 导航将平均任务时间减少了 50.8%,相对于仅顶部导航减少了 26.8%。语义视图选择机制对于目标描述中的词汇变化也具有鲁棒性,在 66 个测试用例中实现了 100% 的准确性,而基于置信度的视图选择基线的准确性为 63.64%。在更大的 Gazebo 环境中,AgenticDiffusion 实现了 90% 的任务成功率并完成了多阶段任务,而 FPV-only 和 Top-only 变体无法完成所有请求的导航任务。