论文

CosFly-VLA:用于无人机跟踪的空间感知视觉-语言-动作模型

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

模型训练监督微调与指令调优

摘要

动态目标跟踪对于在复杂城市环境中运行的无人机 (UAV) 至关重要,因为目标和摄像机视点都在不断变化。现有的视觉-语言-行动(VLA)策略可以有效地跟踪可见目标,但当建筑物、植被或路边物体阻挡视线时,其性能通常会下降。在持续遮挡期间,策略可能会丢失目标状态,对错误区域执行操作,并通过后续观察放大此错误,直到无法重新获取。为此,我们提出了 CosFly-VLA,这是一种空间感知的 VLA 模型,可以共同定位目标、估计其可见度,并通过结构化预测界面生成连续的飞行动作。为了训练这个策略,我们在不同的数据源上使用大规模的配方。 500k 混合池上的空间定位持续预训练 (CPT) 注入无人机视图深度、距离和 3D 空间推理。然后,基于课程的三阶段监督 微调 (SFT) 过程通过多头预热对跟踪器进行专门化,然后对自然和硬/长遮挡数据进行两阶段课程学习。随后,思想链 (CoT) 训练会在结构化答案之前教授面向恢复的推理轨迹。最后,闭环强化学习 (RL) 阶段通过涵盖保持跟踪距离、目标定位质量、避免碰撞和任务成功的多组件奖励来优化跟踪行为。相对于 OpenVLA,CosFly-VLA-0.8B 在可见测试中将开环平均位移误差 (ADE) 降低了 34.1%,在未见测试中降低了 35.3%。闭环优化将成功率 (SR) 分别提高了 29.8% 和 2.5%。这些结果证明了从可见帧模仿到以空间定位为依据的动作闭环控制的进展,并在共享的预言机状态历史下进行了评估。