论文
SOCO:视觉基础模型中语义对象对应的基准测试
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
摘要
由于不一致的评估协议和有限的部件级监督,测量视觉基础模型中的结构化对象理解仍然具有挑战性。语义对应 (SC) 通过测试对象部分是否可以在外观、视点和几何形状发生较大变化的情况下跨实例和类别进行匹配来评估此功能。为了实现系统的 SC 评估,我们引入了 SOCO,这是语义对象对应的新基准,它引入了对应类型的分类法,并在 100 个类别和超过 100 万个对应对中提供一致的、具有功能意义的关键点注释。此外,SOCO 还包括关键点语言描述,能够评估大型视觉语言模型 (LVLM) 及其细粒度的零件级理解。综合实验表明,(i) 视觉基础主干编码强大的语义结构,但跨相关类别的对应关系传输很差,并且仅部分捕获对象部分位置;(ii) LVLM 在文本提示的部分定位方面比视觉参考交叉图像匹配更强,暴露了基于语言的定位和细粒度视觉对应之间的差距;(iii) 对应性能预测密集下游任务的性能,包括分割、跟踪、3D 姿态估计和 3D 检测,比 ImageNet 分类更有效。总之,这些发现使 SOCO 成为视觉和多模态基础模型中结构化、零件级表示质量的基准。