论文

通过上下文学习进行开放词汇场景文本编辑的自提示扩散 Transformer

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

应用与实践内容创作

摘要

场景文本编辑旨在修改图像目标区域中的文本,同时保留周围的背景样式和纹理。现有的方法仅依赖于图像背景信息,而忽略了目标区域的视觉细节,这丢弃了原始文本中的风格特征,本质上降低了文本渲染的任务。此外,预训练字形编码器施加的条件限制了可编辑文本的范围。为了解决这些问题,本文提出了一种自提示场景文本编辑方法,该方法直接从原始图像构建样式和字形提示,而不引入额外的样式或字形编码器。我们采用两阶段训练策略:首先在大规模自监督数据上训练扩散 Transformer,然后使用一小组配对图像进行细化。通过利用多模态扩散 Transformer (MM-DiT) 的上下文学习功能,它实现了开放词汇和风格一致的文本编辑。各种语言的实验结果表明,我们的方法在文本准确性和风格一致性方面都达到了最先进的性能。我们的项目页面:hongxiii.github.io/mstedit。