论文
LCG:具有稀疏关系注意力的长上下文一致图像生成
LCG: Long-Context Consistent Image Generation with Sparse Relational Attention
摘要
最近的图像生成模型在单图像合成中实现了令人印象深刻的质量,但通常无法按照漫画、故事板和视觉叙事的要求保持顺序输出的一致性。我们提出了长上下文生成(LCG),这是一种用于长上下文多图像文本到图像生成的框架,以提高长上下文多图像生成的一致性和可扩展性。 LCG 采用稀疏关系注意 (SRA) 机制来选择性地关注扩展视觉上下文中的核心特征,确保语义和布局信息的传播在计算上保持易于处理。为了强制语义对齐,我们引入了路由一致性约束(RCC),它利用身份感知掩码来跨代分支对齐结构模式,即使在复杂的多角色场景中也能有效减轻外观漂移。为了支持这种情况下的训练和评估,我们构建了长上下文一致性数据集(LCCD),这是一个大规模的合成数据集,包含跨越不同情境上下文的以字符为中心的多图像序列。 LCCD 包含 600K 训练序列和一个单独的 1K 测试集,每个序列包含 6 到 20 个图像。实验表明,LCG 在长上下文图像生成(包括多字符场景)的即时对齐和字符一致性方面优于比较基线。