论文
UAV-Track VLA:通过视觉-语言-动作模型实现空中跟踪
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
摘要
实体视觉跟踪对于无人机(UAV)执行复杂的现实任务至关重要。在具有复杂语义需求的动态城市场景中,视觉-语言-动作(VLA)模型由于其跨模态融合和连续动作生成能力而显示出巨大的前景。为了在此类环境中对多模态跟踪进行基准测试,我们构建了一个专用的评估基准和一个包含超过 890K 帧、176 个任务和 85 个不同对象的大规模数据集。此外,为了解决现有 VLA 模型中时间特征冗余和空间几何先验的缺乏,我们提出了一种改进的 VLA 跟踪模型,UAV-Track VLA。我们的模型建立在 $π_{0.5}$ 架构之上,引入了时间压缩网络来有效捕获帧间动态。此外,并行双分支解码器包括空间感知辅助定位头和流匹配动作专家,旨在解耦跨模态特征并生成细粒度的连续动作。 CARLA 模拟器中的系统实验验证了我们方法的卓越端到端性能。值得注意的是,在具有挑战性的长距离行人跟踪任务中,UAV-Track VLA 实现了 61.76% 的成功率和 269.65 的平均跟踪帧,显着优于现有基线。此外,它在未见过的环境中展示了强大的零样本泛化能力,与原始的 $π_{0.5}$ 相比,将单步推理延迟减少了 33.4\%(至 0.0571s),从而实现高效、实时的无人机控制。数据样本和演示视频可访问:https://github.com/Hub-Tian/UAV-Track_VLA。