论文
促进零样本实例分割的扩散模型
Prompting Diffusion Models for Zero-Shot Instance Segmentation
摘要
计算机视觉领域最近出现了几个颠覆性的研究方向,包括在场景理解甚至交互方面实现了前所未见的零样本性能的基础模型,以及合成极其逼真图像的生成模型。由于其丰富的先验知识,后者也被证明在场景理解任务中非常有效。然而,为了及时分割,基础模型很难准确地分割对象的区域,从而导致误报和过度分割。值得注意的是,利用生成先验的早期尝试仅在后处理期间使用提示,产生次优片段,因为该过程与用户输入无关。在本文中,我们利用 Prompt2Seg(一种基于扩散的分割的空间调节框架)来解决这些限制。 Prompt2Seg 通过调节分支增强了冻结扩散分割模型。我们的方法采用以 2D 高斯或置信图表示的空间提示作为显式输入信号,训练模型直接响应用户意图。 Prompt2Seg 对从 Hypersim 和 Virtual KITTI 2 中提取的一组故意约束的对象类别进行了微调,将零样本推广到各种不可见的对象类型和视觉域。我们评估了七个数据集,从标准基准到更具挑战性的领域,包括绘画、自我中心视图和 X 射线数据。此外,我们证明 Prompt2Seg 在所有基准测试中始终优于底层扩散分割主干。我们的结果表明,生成预训练中编码的丰富先验与有原则的空间条件相结合,为广泛推广交互式分割提供了一条令人信服的道路,而无需大规模掩模监督。