论文

ProtoRAG:基于原型的少镜头细粒度遥感目标检测的检索增强

ProtoRAG: Prototype-Based Retrieval Augmentation for Few-Shot Fine-Grained Remote Sensing Object Detection

上下文与知识检索增强

摘要

遥感图像中的少镜头细粒度目标检测(FGOD)具有挑战性,因为有限的注释必须支持目标定位和视觉相似子类别之间的区分。尽管多模态 大语言模型 (MLLM) 提供了强大的粗略对象定位,但它们缺乏可靠的细粒度识别的明确视觉证据。为了解决这一限制,我们提出了 ProtoRAG,这是一种基于原型的检索增强框架,通过为 MLLM 配备外部对象级视觉内存,将粗定位与细粒度识别分离。为了从有限的支持样本中构建可靠的视觉记忆,我们引入了判别原型空间学习(DPSL),它通过监督对比学习和原型一致性正则化鼓励判别和原型稳定的表示。我们进一步开发了一种不确定性引导的候选约束推理策略,该策略通过检索特定于候选的视觉参考来增强 MLLM,并仅针对不明确的实例调用多模态推理。大量实验表明,ProtoRAG 在 9 个小样本设置中始终超过了代表性基线,在 MAR20、HRSC2016 和 FAIR1M-2.0 上分别比最强基线高出 14.80、2.27 和 4.04 mAP$_{50}$。