论文
InstanceBench:诊断指代分割中的目标身份与推理一致性
InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation
摘要
引用表达式分割 (RES) 将自然语言描述链接到像素级对象掩码。然而,标准评估对实例级参照推理的洞察力有限:它没有系统地区分参照逻辑,测试有效Grounding路径上的目标保留,或将目标选择与掩模生成错误分开。我们推出了 InstanceBench,这是一个以实例为中心的诊断基准,包含 6,194 个图像、9,264 个目标实例和 25,077 个经过人类验证的表情。每个以目标为中心的表达集 (TCES) 都会修复图像和目标掩模,同时将最小表达与使用另一个有效线索或基础路径的相同目标变体配对。紧凑的指称逻辑分类法涵盖直接目标证据、同类选择、关系和组合基础以及排除,而逻辑批判性构造则抑制了更简单的捷径。身份感知指标衡量目标保留和设置级别的成功,同时将选择与掩码生成错误分开。在 18 个模型系列的 22 个原生掩模 RES 检查点中,最强的检查点达到 67.1% mIoU,但只有 59.6% All@0.7。受控干预确认了语言敏感性,而故障分解则确定了目标选择而不是掩模解码是主要瓶颈。在受控训练子集中,匹配监督提高了身份感知性能,表明诊断的能力对有针对性的监督做出了反应。总的来说,InstanceBench 支持测量-诊断-改进循环:测量Grounding路径上的目标一致性、定位故障源以及评估有针对性的干预措施。
