论文

从像素到概念:分割模型理解它们分割的内容吗?

From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

模型评测基准与评测资源

摘要

分割是众多下游应用程序背后的一项基本视觉任务。最近的提示分割模型,例如 Segment Anything Model 3 (SAM3),将分割从与类别无关的掩模预测扩展到以高级文本提示为条件的概念引导定位。然而,现有的基准主要评估掩模准确性或物体存在,不清楚这些模型是否忠实地基于查询的概念,还是依赖于视觉上显着但语义上误导的线索。我们引入 CAFE: \textbf{C}onterfactual \textbf{A}ttribute \textbf{F}actuality \textbf{E}valuation,这是一种用于评估可提示分割模型中概念忠实分割的新颖基准。我们的 \textbf{CAFE} 建立在属性级反事实操作的基础上:保留目标区域和 真值 掩模,同时修改表面外观、上下文或材料成分等属性以引入误导性的语义线索。该基准测试包含 2,146 个配对测试样本,每个样本由一个目标图像、一个 真值 掩码、一个肯定提示和一个误导性的否定提示组成。这些样本涵盖三个反事实类别:表面拟态(\textbf{SM})、语境冲突(\textbf{CC})和本体冲突(\textbf{OC})。我们在 CAFE 上评估各种模型类型和尺寸。实验揭示了定位质量和概念辨别之间的系统性差距:模型通常会生成准确的掩模,即使是误导性的提示,这表明强大的掩模预测并不一定意味着忠实的语义基础。我们的 CAFE 提供了一个受控基准,用于诊断即时分割模型是否执行概念忠实基础而不是快捷方式驱动的掩模检索。