论文
CrossVL:用于跨视图视觉语言检测的复杂性感知特征路由和配对课程
CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection
摘要
视觉语言模型 (VLM) 可以实现文本引导的对象检测,但在地面和空中视点的高度、比例和空间布局不同的交叉视图场景下,性能会严重下降。这些几何变化引入了视点之间的系统复杂性变化,例如,地面图像包含密集且高度遮挡的结构,而航空图像则稀疏且全局组织。固定的 VLM 融合机制无法处理这种差异。我们提出了 CrossVL,这是一个结合了复杂性感知路径聚合(CPA)和配对课程学习(PCL)的框架,用于增强 VLM 的交叉视图检测。 CPA 根据多模态统计数据估计场景复杂性,并通过多种路径路由视觉特征以获得特定于视图的表示。 PCL 利用同步地空对的语义一致性来提供稳定的早期监督,然后逐渐转向随机采样。在 MAVREC 上,CrossVL 将 Florence-2 的空中 mAP 从 58.66% 提高到 61.03%,并将地空性能差距从 8.63pp 缩小到 6.65pp,同时还实现了随机种子方差减少 3.3 倍。 CPA 提供稳定的复杂性感知特征聚合,PCL 增强优化动态。他们共同证明了协调的架构和训练适应对于稳健的跨视图 VLM 检测至关重要。