论文
ScoutVLA:通过双专家 VLA 模型实现以无人机为中心的主动感知,用于开放世界具体问答
ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering
摘要
空中具体问答(EQA)要求无人机(UAV)主动感知环境并回答自然语言问题。现有的室外 EQA 系统通常会在目标进入无人机视野后停止,从而导致寻证问题所需的细粒度视点调整基本上无法解决。为了解决这个问题,我们引入了 FG-EQA,这是一种细粒度主动感知 EQA 基准测试,拥有超过 40K 条模拟轨迹和 1K 条真实世界轨迹。受到侦察蜂“摇摆舞”的启发,侦察蜂会反复调整飞行路径以验证目标信息,我们提出了 ScoutVLA,这是一种用于户外 EQA 的证据驱动的视觉-语言-动作模型。为了模拟这种主动探索行为,ScoutVLA 采用了解耦的双专家架构:视觉语言专家推断语义意图以识别缺失的证据,而独立动作专家则采用高自由度流匹配来生成连续的视点细化轨迹。为了平衡连续控制和语义推理的竞争需求,我们设计了一种具有知识隔离机制的解耦训练策略,可防止动作梯度消除模型的多模态推理能力。广泛的模拟实验和定性的现实世界现场研究都验证了 ScoutVLA 相对于最先进基线的优越性,证明平均严格成功率高出 10.48$\boldsymbol{\times}$,平均 QA 正确性高出 7.72$\boldsymbol{\times}$。