论文
SketchFlow:通过 CLIP 潜在空间中的 GMM 先验流生成零样本矢量草图
SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space
摘要
矢量草图仍然是抽象人类表达最简洁、最直接的媒介之一。然而,由于细粒度、高质量的文本到草图配对数据的严重缺乏,生成表现出类人绘画风格的高质量矢量笔画仍然是一个开放的挑战。现有的文本条件生成方法通常依赖于不稳定、耗时的优化,或者难以以零样本的方式泛化到不可见的类别。为了解决这些限制,我们提出了 SketchFlow,这是一种植根于最佳传输 (OT) 理论和流匹配的新型生成框架。通过利用预先训练的 CLIP 模型绕过劳动密集型的图像级文本注释,我们将跨模态对齐直接表述为 CLIP 潜在空间内的连续映射问题。为了弥合离散文本概念和连续草图特征之间不可避免的模态差距,我们首先将噪声注入离散类别嵌入中,以构建连续高斯混合模型(GMM)先验。然后,我们利用最优传输条件流匹配 (OT-CFM) 模型在目标草图特征分布之前从连续 GMM 中学习确定性向量场映射。最后,融合 1D U-Net 和 Transformer 架构的混合扩散解码器旨在将这些特征解码为快速、高保真的笔划轨迹。大量实验表明,SketchFlow 在视觉质量和遵循自然人类绘画风格方面远远优于现有基线。此外,我们的几何保留框架展示了有前途的局部零样本合成,用于超出 QuickDraw 训练词汇的提示,包括看不见的概念标签和语义修饰符,同时在不同概念之间实现平滑、连续的语义插值。源代码位于:https://github.com/doudin404/SketchFlow。