论文
以任何粒度对任何事物进行计数
Count Anything at Any Granularity
摘要
开放世界的对象计数仍然很脆弱:尽管视觉语言模型(VLM)取得了快速进步,但可靠地计算用户想要的对象还远未解决。我们认为一个核心原因是计数粒度是隐含的。用户可能会引用特定的身份、属性、实例类型、类别或抽象概念,但大多数方法将“计算什么”视为单个类别级别的匹配问题。在这项工作中,我们将开放世界计数重新定义为多粒度计数,其中视觉样本指定目标外观,细粒度文本以及可选的否定提示指定跨五个显式级别的预期语义粒度。然而,明确粒度会暴露出一个关键的数据瓶颈:现有的计数数据集缺乏验证细粒度提示语义所需的多类别场景、受控干扰因素和实例级注释。为了解决这个问题,我们提出了第一个全自动数据缩放管道,它将可控 3D 合成与一致的图像编辑和基于 VLM 的过滤集成在一起,并用它来构建 KubriCount,这是迄今为止最大、注释最全面的计数数据集,支持训练和多粒度评估。系统基准测试表明,多模态 大语言模型 和专业计数模型在细粒度区分下都表现出严重的提示跟随失败。受这些发现的启发,我们训练了 HieraCount,这是一种多粒度计数模型,联合利用文本和视觉样本作为补充目标规范。 HieraCount 大大提高了多粒度计数的准确性,并可以稳健地推广到具有挑战性的现实场景。项目页面位于:https://verg-avesta.github.io/KubriCount/。