评估多模态 LLM 作为无人机控制的通用视觉-语言-动作代理:指挥、接近、跟踪和搜索
Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
摘要
多模态 大语言模型 (MLLM) 是图像和视频的强大感知者。我们询问这种影响范围能延伸到多大程度:将 MLLM 直接放入无人机的控制回路中,其整个动作空间仅在提示中声明。最近的系统接近这种设置,但越来越缩小模型的决策范围。我们把它加宽。我们引入了 DroneCATS-Agent(一种以 MLLM 为可交换组件的架构)和 DroneCATS(将模型视为自变量的基准)。除了仅仅飞向像素之外,我们的代理还委托模型进行偏航和搜索,在不确定时进行深思熟虑,并自我声明到达——所有这些都不需要 微调 或函数调用模式。通过评估四种核心能力的前沿和开放模型——接近可见目标、跟踪移动目标、在初始视野之外搜索以及指挥多无人机机队——发现即使是最简单的具体设置也远未得到解决。至关重要的是,为了确定最先出现边缘问题的因素,我们的名单缩减至 2B 参数。研究结果暴露了一个鲜明的悖论:失败的并不是飞行。小型开放模型通常比前沿模型更可靠地进入成功半径,但却因过早宣布到达或根本不宣布到达而失去了机会。多无人机指挥放大了这种分歧,小型模型因盲目地跨不同视图复制单个坐标而失败。这些模型被视为视觉-语言-动作代理,其空间感知成立,但其行动协议却不然。可部署边缘模型与前沿模型的区别不是导航,而是维持已声明协议并发出正确终止操作的规则。悬而未决的问题是缩小机载计算成本的差距——产生一个持续计划并准确知道何时完成的快速模型——而 DroneCATS 就是为了测量这个距离而构建的。