论文
StyleTextGen:样式条件多语言场景文本生成
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
摘要
样式条件场景文本生成在从复杂背景中提取精确的文本样式并保持字符之间的细粒度样式一致性方面面临着独特的挑战,特别是对于多语言脚本。我们提出了 StyleTextGen,这是一个新颖的框架,可以学习感知和复制跨不同语言和书写系统的视觉文本样式。我们的方法具有三个关键贡献:首先,我们引入了专用于样式建模的双分支样式编码器,在复杂的现实世界场景中产生强大的多语言文本样式表示。其次,我们设计了一种文本样式一致性损失,可以增强样式连贯性并提高整体视觉质量。第三,我们开发了一种掩码引导的推理策略,确保生成文本和参考文本之间的精确风格对齐。为了便于系统评估,我们构建了 StyleText-CE,这是一个涵盖单语和跨语言设置的双语场景文本样式基准。大量实验表明,StyleTextGen 在样式一致性和跨语言泛化方面显着优于现有方法,在多语言样式条件文本生成方面建立了新的最先进性能。