论文
Sidecar:无需训练 语义重用,实现角色一致的自由形式视觉叙事
Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
摘要
视觉叙事需要生成遵循叙述的图像,同时保持跨帧的一致的角色身份。在自由形式的故事生成中,仅在首次介绍时才完整描述角色,然后通过类型级别的提及或代词来引用该角色。虽然这种设置更好地反映了自然的讲故事,但后面的提示可能会省略重要的身份相关语义,从而使角色一致性更难以维护。我们提出 \textbf{Sidecar},一个即插即用的语义增强模块,它保留初始描述中的实体级信息,并将缺失的语义注入到以后的提示嵌入中。 Sidecar 不需要额外的训练,也不会修改基础扩散模型的架构。 FreeStoryBench 上的实验表明,Sidecar 在多个基于 SDXL 和 FLUX 的基线上持续改进了提示图像对齐和字符一致性,而计算开销可以忽略不计。