论文
MLLM 时代显着目标检测复兴了吗?
Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?
摘要
多模态 大语言模型 (MLLM) 的零样本功能正在推动显着目标检测 (SOD) 超越特定任务的监督。为了使 MLLM 摆脱传统的基于掩模的评估,我们将 SOD 分解为定位和分段,并使用短语、框和属性重新设计数据集,建立 MLLM 显着性感知 (SaliLLM) 的诊断基准。 SaliLLM 发现了一个惊人的能力不匹配:MLLM 在定位方面优于最先进的 (SOTA) 方法,但在分割方面仍然明显较弱。进一步的分析将这种差距主要归因于 MLLM 和前景基数、粒度和范围的注释之间的不匹配。受这一诊断的启发,我们将零样本 SOD 重新塑造为协议一致的前台组织,并引入了第一个 无需训练 框架,该框架利用格式塔启发的统一 SOD 协作关注 (FOCUS)。 FOCUS 将协议条件前景粒度的自上而下的贝叶斯意外校准与自监督特征引起的以实体为中心的感知流形上的 MLLM 证据自下而上的传播相结合,产生连贯的对象范围作为通用分段器的提示。在 13 个 RGB、RGB-D 和 RGB-T SOD 基准测试中,FOCUS 总体优于未经训练的 SOTA 方法,与完全、弱和自监督方法相比,平均绝对误差分别降低了 11%、34% 和 48%。我们的发现标志着 SOD 的复兴:从特定任务监督到零样本前台组织。代码可在补充材料中找到。