论文

AdaCount:无需训练 相似性引导的空间和特征适应,用于零样本对象计数

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

应用与实践视觉感知与空间理解

摘要

零样本对象计数(ZOC)旨在对仅通过文本提示指定的任意对象类别的实例进行计数。最近的 无需训练 方法利用 SAM 等基础模型将计数重新制定为提示驱动的分割任务,从而消除了使用点级注释的昂贵的计数特定训练数据的需要。最近,SAM3 引入了提示概念分割,支持对与文本定义概念相对应的所有实例进行零样本分割。然而,SAM3 在包含大量小物体的人口稠密场景中表现不佳,其中有限的图像分辨率和对目标相关区域的关注不足常常导致实例丢失和实例分离不良,从而阻碍了准确的物体计数。为了解决这个限制,我们提出了 AdaCount,这是一种基于相似性引导的空间和特征适应的 无需训练 框架。 AdaCount 首先估计一个原型驱动的相似性图,该图可识别目标相关区域。该相似性图随后引导两种互补的适应:(i)相似性引导的空间扭曲,其将图像分辨率重新分配给目标实例;​​以及(ii)特征调制,其放大与目标相关的编码器表示。总之,这些调整使 SAM3 能够将更大的表征能力投入到目标相关区域,同时保留全局图像上下文,而无需任何模型重新训练。跨越六个不同计数基准的广泛实验将 AdaCount 确立为 无需训练 ZOC 方法中的新 SOTA。