论文
真的很重要吗?评估文本引导的类不可知计数中的语义基础
Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting
摘要
开放世界文本引导的类不可知计数 (CAC) 已成为一种灵活的范例,用于通过使用自然语言提示来计数任意对象类。然而,当前的评估协议主要关注单类别图像中的标准计数错误,忽略了一个基本要求:能够在视觉场景中正确地提供文本提示。在本文中,我们展示了几种最先进的 CAC 模型经常难以根据给定的提示确定应该计算哪个对象类,从而揭示了文本语义和视觉对象表示之间的不一致。这种限制会导致虚假计数响应并降低现实场景中的可靠性。为了系统地解决这些局限性,我们提出了一个新的评估框架,重点关注模型的稳健性和可信度。我们的贡(ii) 我们提出了 MUCCA(MUlti-Category Class-Agnostic 计数)评估数据集,这是一个新的现实世界图像集合,每个场景具有多个带注释的对象类别,这与现有的 CAC 基准通常每个图像包含一个类别不同。我们对 10 种最先进方法进行的广泛实验评估表明,尽管在标准计数指标下表现强劲,但当前模型在理解和基础对象类描述方面表现出明显的弱点。最后,我们对提示之间的语义相似性如何影响这些失败进行了定量分析。总的来说,我们的结果强调了对更加基于语义的架构的需求,并为开放世界文本引导 CAC 方法的未来评估提供了可靠的框架。