论文
机器真的能看到图像中的物体吗?基于句法距离和视觉自指实例的研究
Can Machines Really See Objects in Images? A Study Based on Syntactic Distance and Visual Self-Referential Instances
摘要
视觉模型能否真正看到物体,还是只适合表面视觉线索?遵循维特根斯坦的观点,即语言的限制就是世界的限制,我们认为模型的识别能力受到它所学到的描述系统的限制。在当前的视觉模型中,该系统通常是通过利用本地统计线索的学习特征表示来实现的。因此,我们要问,当此类局部线索无法提供稳定的区分基础时,模型是否仍然可以正确分类。我们用句法距离形式化这个问题,它通过将一个类映射到另一个类的操作的对称性来衡量类的可分离性:正距离暴露可利用的局部特征,而零距离需要全局语义而不是局部规则。我们在最大方差二元噪声中构建了一个视觉自指任务:正样本包含一个封闭的正方形,而负样本包含一个具有一个翻转边界像素的其他相同的正方形。这两个类在全局语义上有所不同,但句法距离为零,使得局部统计快捷方式不可靠。 ResNets 和 Vision Transformer 上的实验揭示了一致的相变现象,一旦图像比例跨越临界点并且无法恢复到测试范围内,精度就会崩溃为随机猜测。更大的训练集和模型只会延迟这种崩溃,而全局关注的 ViT 会更早地达到这种崩溃。这些结果揭示了当前架构在全局概念任务上的结构能力边界,表明通用智能可能需要创建新的语言,而不是重用现有的语言。