论文
剪影引导动物艺术的视觉检索增强生成
Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art
摘要
生成式人工智能提高了渲染逼真或艺术图像的能力,但它在人类创造力的一个关键方面仍然受到限制:解释模糊的形状。这种现象源于幻想性视错觉,它使人类能够感知随机图案中有意义的形式,例如云、石头或树叶。为了通过计算复制这一富有想象力的过程,我们引入了视觉检索增强生成(Visual-RAG),这是一个直接从自然轮廓生成动物艺术的框架。我们的方法从 28,586 个高质量剪影的精选语料库中检索结构相似的动物形状,并将它们用作参考范例,以指导使用 ControlNet 和 IP-Adapter 进行基于扩散的生成。消融研究证实,使用 RANSAC 的形状上下文可提供最准确的对齐,而去除形状标准化可将内点率降低至仅 13.4%,强调了 Visual-RAG 中结构保真度的重要性。一项由 12 名参与者参与的用户研究从美观、轮廓保真度和整体印象方面评估了输出结果。结果表明,虽然 Visual-RAG 提供了合理的解释,但在实现高感知影响方面仍然存在挑战。这项工作为计算幻想性幻想奠定了基础,展示了机器如何为富有想象力的发现的早期阶段做出贡献。