论文
DouC:用于 无需训练 开放词汇分割的双分支 CLIP
DouC: Dual-Branch CLIP for Training-Free Open-Vocabulary Segmentation
摘要
开放词汇语义分割需要分配像素级语义标签,同时支持开放且不受限制的类别集。基于 无需训练 CLIP 的方法保留了强大的零样本泛化能力,但通常依赖于单一推理机制,限制了它们联合解决不可靠的本地标记和空间一致性不足的能力。我们提出了 DouC,一种 无需训练 双分支 CLIP 框架,它将密集预测分解为两个互补的组件。 OG-CLIP 通过轻量级的推理时间词元门控提高了补丁级可靠性,而 FADE-CLIP 通过冻结视觉基础模型引导的代理注意力注入外部结构先验。这两个分支在 logits 级别融合,使本地词元可靠性和结构感知补丁交互能够共同影响最终预测,并应用可选的实例感知校正作为后处理。 DouC 没有引入额外的可学习参数,不需要重新训练,并且保留了 CLIP 的零样本泛化能力。跨八个基准和多个 CLIP 主干的广泛实验表明,DouC 始终优于之前的 无需训练 方法,并且可以很好地扩展模型容量。