论文
使用基础图像生成模型诊断鸟瞰目标探测器
Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models
摘要
大规模图像生成模型的最新进展使得具有可控属性的逼真场景合成成为可能。除了数据增强之外,它们作为经过训练的视觉系统的诊断工具的潜力在航空和遥感领域仍未得到探索。我们引入了一种用于鸟瞰车辆检测的综合诊断框架,该框架结合了文本引导生成、属性控制编辑和自动属性验证来构建可控的综合测试平台。这使得能够在难以在真实数据集中隔离的不同场景类型和环境条件下对预训练的检测器进行细粒度评估。在三种检测架构和三个真实航空数据集中,合成的场景性能趋势与现实世界的弱点紧密匹配。在这些诊断的指导下,使用来自已识别的弱类别的小型真实数据集进行有针对性的补充,可将 AP50 提高高达 13%,同时比非针对性增强所需的额外样本要少得多。我们的结果表明,受控合成探测可以预测实域性能差距并指导有效的数据收集。所提出的诊断框架是模块化的,随着功能的发展,可以合并替代的生成或视觉语言模型。我们的代码和数据集可以在这里找到:https:// humansensinglab.github.io/AVODDiag/