论文

C-GAP:班级感知和在线提示改进了不平衡班级的视觉语言模型

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

上下文与知识上下文工程

摘要

安全关键的感知系统必须可靠地检测小标签空间内的稀有物体类别,而针对具有密集注释的数百个类别而设计的长尾检测方法从根本上无法解决这一问题。开放词汇检测器提供了一个有前途的替代方案,因为它们在推理时使用自然语言查询,使提示质量成为检测性能的一流杠杆。我们利用这个属性来解决类别不平衡问题:我们不是重新训练模型或收集额外的注释,而是询问迭代地细化语言提示,输入冻结检测器是否可以改善少数类别检测。我们引入了 C-GAP 图像描述引导增强和提示),这是一个与检测器无关、无注释的框架,分两个阶段运行。首先,我们建立了一个将每图像场景描述与类数量上下文相结合的复合图像描述基线,我们在多个开放词汇架构和基准中显示,该基线优于仅场景描述或仅类数量提示。其次,LLM 迭代地单独细化每个图像的标题,并根据少数类 AP@0.5 与从复合基线派生的动态阈值进行试验,将其分类为接受、暂定或重新生成桶。一旦获得足够的 AP@0.5 增益,细化就会提前终止。在任何阶段都不会更新探测器权重。我们的实验表明,C-GAP 将少数类别的平均精度比基线提高了 53%。在 COCO 上,C-GAP 将少数类 AP@0.5 相对于复合基线 (17.69 -> 32.09) 提高了约 81%。实验证实,复合图像描述为有效细化提供了关键基础:使用仅场景描述或仅类数量提示作为细化起点会产生收益递减,支持 C-GAP 的两个阶段作为必要的贡献。