论文
RT-Counter:实时文本引导的开放词汇对象计数
RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting
摘要
文本引导的开放词汇对象计数(TOOC)旨在对属于自然语言描述指定类别的对象进行计数。尽管视觉语言预训练模型已成功应用于 TOOC 任务,但它们仍然难以满足计数场景中的细粒度空间理解和实时推理要求。为了解决这些限制,本文提出了一种实时 TOOC 框架,称为实时计数器(RT-Counter),它不仅具有良好的计数精度,而且具有较高的计算效率。 RT-Counter设计了一种新颖的视觉原型文本化(VPT)模块,可以将学习到的视觉特征投影到文本特征空间中,然后生成包含视觉原型难以捕获的抽象信息和文本难以描述的详细原型信息的特征,增强对象级视觉语言模型的计数能力。此外,RT-Counter 还结合了我们的 Weaving Transformer (Weaformer) 层,以极低的计算成本保持高描述能力。 Weaformer 层采用了一种新颖的混合注意力机制,可以有效地将局部和全局视觉特征编织在一起。对三个公共数据集的广泛实验表明,RT-Counter 成功打破了 TOOC 中准确性与速度的权衡。 RT-Counter 在 FSC147 上实现了具有竞争力的 13.30 MAE,同时以 112.48 FPS 运行,与 TOOC 中现有的领先方法相比,速度提高了 7.4 倍,参数效率提高了 4 倍以上。我们的工作旨在平衡 TOOC 的高精度和实时性能。代码位于:https://github.com/Jason-Mar1/RT-Counter。