论文

INSID3:无需训练 使用 DINOv3 进行上下文分割

INSID3: Training-Free In-Context Segmentation with DINOv3

应用与实践视觉感知与空间理解

摘要

上下文分割(ICS)旨在根据一个带注释的视觉示例来分割任意概念,例如对象、部分或个性化实例。现有工作依赖于(i)微调 视觉基础模型(VFM),它改善了域内结果,但损害了泛化,或(ii)组合了多个冻结的 VFM,它保留了泛化,但产生了架构复杂性和固定的分割粒度。我们从极简主义的角度重新审视 ICS 并提出问题:单个自监督骨干网能否在没有任何监督或辅助模型的情况下支持语义匹配和分割?我们表明,DINOv3 的放大密集自监督特征表现出很强的空间结构和语义对应性。我们引入了 INSID3,这是一种 无需训练 方法,在给出上下文示例的情况下,仅从冻结的 DINOv3 特征中以不同的粒度分割概念。 INSID3 在一次性语义、部分和个性化分割方面实现了最先进的结果,比之前的工作提高了 7.5% mIoU,同时使用的参数减少了 3 倍,并且没有任何掩码或类别级监督。代码可在 https://github.com/visinf/INSID3 获取。