论文
AttriStory:使用扩散模型进行视觉叙事的细粒度属性实现
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
摘要
使用扩散模型的视觉叙事在保持叙事场景中的角色一致性方面取得了令人印象深刻的进步。然而,仍然存在一个关键差距:虽然这些方法确保角色在场景中保持一致,但它们没有提供系统方法来确保细粒度属性(例如衣服、配饰的颜色和纹理)是否在生成的图像中忠实呈现。为了实现这一目标,我们引入了 AttriStory,这是一个在视觉叙事中实现属性实现的基准。我们使用 大语言模型 策划了 200 个跨 10 种不同艺术风格的多场景故事。每个场景都采用详细的属性规范构建,以实现丰富的视觉叙事。此外,为了解决属性实现问题,我们提出了一种即插即用的潜在优化模块,该模块在模型建立结构和语义内容时的早期去噪步骤中运行。我们通过 AttriLoss 目标来实现这一目标,该目标旨在最大化所需属性-对象对的交叉注意图之间的对齐,同时抑制虚假关联,指导模型正确定位属性。这种方法与现有的一致性机制正交,与当前的故事生成管道无缝集成,无需进行架构修改。我们的实验证明了在所有基线上合并 AttriLoss 的持续改进。这项工作将属性实现定位为视觉叙事的一个独特的、互补的维度,与角色一致性一起,推动该领域朝着细粒度属性控制的故事生成方向发展。项目页面:https://manogna-s.github.io/attristory/