论文

WareFly-VLA:仓库无人机导航与跟踪的统一评测

WareFly-VLA: A Vision-Language-Action Framework for UAV Navigation and Human Tracking in Smart Warehouses

智能体系统Agent任务评测

摘要

视觉-语言-动作(VLA)模型在机器人操纵和地面移动导航方面取得了令人印象深刻的成果,但智能仓库中无人机(UAV)的语言条件控制在很大程度上仍未得到探索,因为缺乏共同提供连续低空飞行动作、细粒度自然语言目标描述和现实工业环境的基准的阻碍。本文介绍了 WareFly-VLA,这是一种逼真的无人机 VLA 框架和数据集,用于仓库环境中语言引导的人类搜索、本地化和跟踪。它包含在 NVIDIA Isaac Sim 中收集的 507 个人工遥控飞行场景和 8,504 个高分辨率 RGB 过渡,每个场景都配有人工编写的目标工作人员外观描述和同步的四自由度控制命令。涵盖两项空中任务:目标接近和人员跟踪、遮挡、远程搜索、高度变化和杂波。在两种控制速率下的无泄漏事件级协议下建立了四种开源VLA架构(SmolVLA、GR00T N1.7、pi_0和OpenVLA)的统一基准。结果表明,仓库中的语言条件空中控制远未得到解决:在严格的泛化设置下,性能大幅下降,连续动作建模始终优于离散动作标记化,只有前向通道可以从单帧中可靠地学习,并且当前的基础模型接口从地面和人形实施例到空中平台的迁移很差。同步视频、语言、动作、姿势和难度注释进一步支持世界模型研究。数据集、基线和评估协议的发布是为了支持智能仓库中基于语言的空中自主。

WareFly-VLA:仓库无人机导航与跟踪的统一评测:论文原图
图 2:数据集概览。 (a) 剧集长度分布;红色虚线标记平均值。 (b) 按升序排列的每集帧数。 (c) $15$ 短语中的任务动词分布;接近和跟随占主导地位,另外十三个动词家族确保了释义的多样性。