论文

UniRef-UAV:无人机图像通用参考的多模态基准

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

模型评测基准与评测资源

摘要

无人机 (UAV) 越来越依赖视觉定位功能,根据复杂空中场景中的不同指令来定位与任务相关的目标。然而,现有的引用表达理解(REC)基准和方法主要是围绕纯文本查询和单对象输出构建的,这限制了它们在涉及参考图像、多模态指令、缺失目标和多个有效目标实例的实际无人机场景中的适用性。为了解决这一差距,我们引入了 \emph{Universal Referral},这是一种通用的 UAV 引用任务,可共同扩展查询模态和输出基数。我们构建了 \emph{UniRef-UAV},一个多模态基准测试,支持具有模态相关目标基数的纯文​​本、纯图像和文本+图像查询,其中纯文本和文本+图像查询允许无目标、单目标和多目标定位,而纯图像查询则专注于存在感知的单实例定位。它还为视觉查询泛化提供域内和跨域评估协议。我们进一步提出了 \emph{UAV-URNet},一种检测式基线,它将异构查询映射到共享查询空间,并通过集合预测来预测可变大小的目标集。大量实验表明,与大型通用 MLLM 相比,UAV-URNet 提供了稳定且可重复的基线,具有更一致的无目标辨别能力和更轻量级、可重复的实现。其他领域分析、查询表示分析和消融研究表明,多模式查询有助于减少视觉查询歧义并促进更统一的查询-目标对齐空间。注释、视觉查询裁剪/图像、训练/验证/测试分割、评估脚本和基线代码将公开,以促进可重复的研究。