论文

FreeStory:无需训练 自由形式视觉叙事的角色一致性

FreeStory: Training-Free Character Consistency for Free-Form Visual Storytelling

应用与实践内容创作

摘要

视觉叙事的目的是生成既符合叙事提示又在图像中人物外观一致的图像序列。最近的 无需训练 方法通过重用注意力特征来提高字符一致性,但依赖于结构化提示,其中每个提示中都会重复完整的字符描述。这种假设简化了任务,但偏离了自然的故事讲述,在故事讲述中,角色通常只介绍一次,然后使用代词或基于类型的表达来提及。我们提出 \textbf{FreeStory},一个 无需训练 框架,它将自由格式提示下的字符一致性重新表述为基于实体的特征重用。我们的方法将参考提及与其相应的字符描述相关联,并结合动态字符掩码、对应感知特征匹配、键值注入和查询混合来保留身份,同时保留生成多样性。我们还引入了 \textbf{FreeStoryBench},这是此设置的基准,包括单角色和多角色故事。实验表明,FreeStory 在结构化基准上实现了 无需训练 方法中最先进的性能,并且在自由形式提示下比基准具有更强的整体一致性。