论文
SADL:要忽略什么?主题感知干扰源定位的基准
SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization
摘要
除了预期拍摄对象的前景和背景之外,照片还经常包含\emph{视觉干扰物},这些干扰物会争夺注意力并削弱构图。虽然现代编辑工具简化了对象删除,但识别要删除的对象仍然主要是手动过程。现有的显着性模型和开放词汇检测器在没有主题意识的情况下运行,无法适应不断变化的用户意图。此外,与上下文无关的移除可能会破坏场景的语义一致性(例如,保留人物但移除他们坐的椅子)。为了解决这些限制,我们将主题感知干扰物定位的任务形式化,该任务可以识别干扰物,同时保留构图上重要的物体。本文介绍了 \textsc{SADL},这是该任务的第一个现实世界基准,包含 1,000 张照片中的 1,800 个主题感知案例,以实现系统评估并促进未来的研究。总共有 14,617 个带注释的候选者,其中包括一组强大的 1,938 个用于压力测试排除校准的硬阴性。我们在干扰项分类的顺序管道上评估七个专有的开放权重视觉语言模型(VLM),然后进行排除过滤,围绕五个包含因素和三个上下文排除规则构建。我们的分析表明,VLM 非常有能力识别干扰因素,但随后会过度应用排除,从而系统地大规模抑制真正的干扰因素。通过暴露这个关键瓶颈,\textsc{SADL} 提供了一个基础诊断工具来推进多模态系统中的主题条件推理。