论文
UniCounting:合并实例提案实现多类计数
UniCounting: Instance-Aware Proposal Consolidation for Image-Query-Free Multi-Category Counting
摘要
视觉计数通常被表述为对单个指定目标进行计数,模型接收特定于图像的示例、文本查询或目标类别并返回单个计数。相反,我们研究固定词汇、无图像查询的多类别计数。每次运行的全局词汇表都是固定的,并且仅给定 RGB 图像,模型就会预测完整的类别计数向量,而无需告知出现哪些类别。我们提出了 UniCounting,它将计数作为对超完备提案集的实例感知结构推理。通用分段器产生重复的掩模、部分视图和来自相邻实例的建议;语义分数可以命名它们,但无法确定它们表示同一对象。 Frozen SAM~2.1 生成掩模,而冻结 DINOv2 和 OpenCLIP 提供关系和类别特征。 3,267-参数类别共享关系头从实例掩码派生的监督中预测相同实例的亲和力。然后,稀疏图构建、代表性选择、标签和背景边缘准入将每个准入组件转换为具有可重播组证据的一个计数。仅训练关系头,没有计数或密度图目标。在 COCO clean500 上,UniCounting 获得比校准的 OWLv2-All80 更低的点估计向量 $\ell_1$ 误差和缺席类虚假质量,并具有可比的微存在 F1。在匹配的解码器下,学习到的关系减少了与掩码包含、掩码 IoU、CLIP 和 DINO 相关的错误,同时揭示了碎片合并权衡。我们还报告了 OmniCount-sub、FSC-147 和 CARPK 的转移诊断。
