论文

SCI-CLIP:用于 无需训练 开放词汇分割的以段为中心的推理和参考内存

SCI-CLIP: Segment-Centric Inference with Reference Memory for Training-Free Open-Vocabulary Segmentation

应用与实践视觉感知与空间理解

摘要

无需训练 开放词汇分割仍然受到缺少推理抽象的限制。冻结的视觉语言特征是在补丁级别生成的,但密集预测需要一个同时控制特征交互、空间支持、上下文恢复和基于检索的校正的单元。我们提出了 SCI-CLIP,一个以片段为中心的推理框架,其建立的原则是同一区域抽象应该组织密集开放词汇预测的所有阶段。 SCI-CLIP 首先在冻结的视觉标记上诱导区域一致的交互图,然后通过在该图上传播值来重建密集特征,仅在局部证据不足的情况下通过选择性跨窗口支持来增强它们。随后使用相同的片段抽象来构建和查询离线参考存储器,将样本检索与进行预测的单元对齐。 SCI-CLIP 将冻结的 CLIP 式特征转变为空间连贯、上下文感知且与检索兼容的密集预测,无需任何训练。 SCI-CLIP 不断提高密集预测的结构质量、上下文推理的稳健性以及基于样本的校正的一致性,从而在八个基准上产生更强大的开放词汇分割。项目代码位于:https://github.com/mzamini92/SCICLIP。