论文

LiteVLA-H:用于机载空中制导和语义感知的双速率视觉-语言-动作推理

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

模型优化端侧模型

摘要

视觉-语言-动作(VLA)模型在操作方面表现出了强大的语义基础和任务泛化能力,但空中部署仍然很困难,因为无人机在严格的机载计算和通信限制下需要低延迟闭环引导。我们推出了 LiteVLA-H,这是一款紧凑型 256M 参数 VLA 系统,专为 NVIDIA Jetson AGX Orin 上的双速率操作而设计:用于短动作词元输出的快速外环引导模式和用于场景理解、危险描述和面向操作员的叙述的较慢语义模式。核心经验观察是,在这种紧凑的边缘机制中,端到端延迟主要由多模态预填充主导,而不是由解码一些额外词元的边际成本主导。这促使调度程序以 50.65,ms (19.74,Hz) 的速度发出反应动作词元,同时仍然在同一嵌入式平台上以 149.90--164.57\ms (6.08--6.67,Hz) 支持句子级语义输出。为了在不破坏其描述能力的情况下专门化模型,我们使用了知识保存的 微调 配方,该配方混合了反应式飞行数据、航空语义数据和通用标题/VQA 监督。除了报告当前的延迟测量之外,我们还针对最新的最先进架构(包括 AnywhereVLA、FutureVLA 和 ReMem-VLA)定位系统,表明测量的操作分支在我们的部署条件下达到了更高的边缘推理率,同时保留了周期性语义感知。