论文
我们真正测量的是什么?通过无监督语义聚类重新思考网络规模自然图像集合中的数据集偏差
What Are We Really Measuring? Rethinking Dataset Bias in Web-Scale Natural Image Collections via Unsupervised Semantic Clustering
摘要
在计算机视觉中,量化数据集偏差的流行方法是训练模型来区分数据集。然后,高分类准确率被解释为有意义的语义差异的证据。这种方法假设标准图像增强成功地抑制了底层非语义线索,因此任何剩余的性能都必须反映真正的语义分歧。我们证明这一基本假设在大规模自然图像集合领域是有缺陷的。高分类精度通常是由基于分辨率的伪影驱动的,这些伪影是由本机图像分辨率分布和调整大小期间的插值效应产生的结构指纹。这些伪影形成了强大的、特定于数据集的签名,尽管传统的图像损坏仍然存在,但这些签名仍然存在。通过受控实验,我们表明模型即使在非语义、程序生成的图像上也能实现强大的数据集分类,证明它们对表面线索的依赖。为了解决这个问题,我们重新审视了已有数十年历史的数据集可分离性的想法,但不是使用监督分类。相反,我们引入了一种无监督的方法来测量真正的语义可分离性。我们的框架通过对基础视觉模型中语义丰富的特征进行聚类来直接评估语义相似性,故意绕过数据集标签上的监督分类。当应用于主要的网络规模数据集(这项工作的主要焦点)时,监督方法报告的高可分离性很大程度上消失了,聚类精度下降到接近偶然的水平。这表明传统的基于分类的评估系统性地夸大了语义偏差。