论文
Diff-SBSR:学习多模态特征增强扩散模型,用于基于零样本草图的 3D 形状检索
Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval
摘要
本文首次探索了基于零样本草图的 3D 形状检索(ZS-SBSR)的文本到图像扩散模型。由于缺乏类别监督和草图输入的极度稀疏,现有基于草图的 3D 形状检索方法在零样本设置中举步维艰。我们的主要见解是,大规模预训练扩散模型本质上表现出开放词汇能力和强烈的形状偏差,使它们非常适合零样本视觉检索。我们利用冻结的稳定扩散主干从草图和渲染的 3D 视图的中间 U-Net 层中提取和聚合判别表示。由于草图的极端抽象性和稀疏性,以及与自然图像之间的显着域差距,扩散模型很难处理草图。为了在不进行昂贵的再训练的情况下解决这一限制,我们引入了一种多模态特征增强策略,该策略利用来自 CLIP 的互补视觉和文本提示来调节冻结扩散主干,显式增强语义上下文捕获并专注于草图轮廓的能力。具体来说,我们注入源自预训练 CLIP 视觉编码器的全局和局部视觉特征,并通过将可学习的软提示与 BLIP 生成的硬文本描述相结合来合并丰富的文本指导。此外,一旦负样本充分分离,我们就会利用 Circle-T 损失来动态增强正对吸引力,从而适应草图噪声并实现更有效的草图 3D 对齐。对两个公共基准的广泛实验表明,我们的方法始终优于 ZS-SBSR 中最先进的方法。