论文
ViCo-SAM3:用于开放词汇伪装对象分割的视觉条件对齐
ViCo-SAM3: Vision-Conditioned Alignment for Open-Vocabulary Camouflaged Object Segmentation
摘要
开放词汇伪装对象分割(OVCOS)旨在在文本引导下分割看不见的伪装对象。我们观察到 SAM3 仍然存在全局文本语义和 OVCOS 中细粒度像素级视觉线索之间的明显语义差距。同时,完全微调文本编码器会带来大量参数开销,并且存在过度拟合训练类别的风险,从而损害了开放词汇表表示的灵活性。为了解决这些问题,我们提出了 ViCo-SAM3,这是一种专为 OVCOS 设计的视觉条件对齐框架。具体来说,我们引入了视觉条件(ViCo)模块,该模块利用全局视觉上下文动态调整文本嵌入,使文本表示能够适应当前的图像内容,从而有效地弥合视觉和文本之间的语义差距。在此基础上,我们进一步设计了一个视觉条件跨模态绑定(ViCoBind)模块,以增强视觉和文本表示之间的跨模态交互和语义对齐。 ViCo-SAM3 没有任何附加功能,在 OVCamo 基准测试中实现了最先进的性能,并展示了强大的泛化能力。