论文

AeroDPO:通过高保真感知和自动偏好优化释放轻型无人机导航能力

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

模型训练偏好优化

摘要

无人机视觉语言导航 (UAV-VLN) 需要在复杂的 3D 环境中进行快速反应控制。最近的极简端到端范例显示出巨大的前景,但通常依赖于包含数十亿参数的大规模语言模型,从而导致现实世界边缘部署的延迟过高。在本文中,我们挑战了这种对参数的严重依赖。全面的跨尺度评估揭示了感知质量从根本上超过语言推理能力的批判性见解。我们证明,配备高保真视觉输入的轻量级 2B 模型与大规模 7B 基线的总体成功率完全匹配。然而,这种极简主义策略暴露了纯行为克隆(BC)固有的基本稳健性缺陷。由于缺乏明确的负反馈,代理无法内化强大的空间约束,并在分布外(OOD)场景中表现出惊人的冲突率。为了在不依赖不可扩展的人工注释的情况下克服此漏洞,我们提出了 AeroDPO,这是一种由确定性物理模拟状态回滚驱动的零成本自动化直接偏好优化管道。检测到碰撞后,系统会自动倒回环境,以提取因果推理错误作为被拒绝的操作,应用解耦的特权干预来合成避免碰撞的首选操作,并利用离线视觉语言检查器来过滤视觉模糊性。通过为我们的 2B 模型配备这种自动数据飞轮,AeroDPO 将未映射场景的成功率提高到 49.16%,同时大幅抑制碰撞率,为自主空中代理建立了新的 SOTA。