论文
InnoText:视觉文本生成和编辑的统一模型
InnoText: A Unified Model for Visual Text Generation and Editing
摘要
扩散模型最近在高保真图像合成方面取得了显着的成功,但其在视觉文本生成和编辑中的应用仍然相对未得到充分探索。与一般图像生成不同,视觉文本任务需要精确的结构规律性和易读性,这可能会给小规模文本和非拉丁文字(例如中文)带来额外的挑战。现有的基于 UNet 的模型通常难以生成清晰且连贯的文本,而基于 DiT 的模型虽然更具表现力,但通常仅限于单个任务,这可能会导致冗余的训练管道、不一致的视觉风格以及跨任务泛化能力的降低。为了应对这些挑战,我们提出了 InnoText,这是一个基于 DiT 的统一框架,能够在单个模型中执行文本生成和编辑。我们引入了字体大小感知调制(FSAM)模块来增强跨字体比例的表示,引入小字符感知增强策略来提高细粒度保真度,以及用于自适应优化的任务特定区域加权损失。为了支持训练和评估,我们还构建了涵盖不同字体、大小和背景的高质量双语(英汉)视觉文本数据集。实验结果表明,我们的方法实现了卓越的生成精度和编辑质量,生成了视觉上吸引人且逼真的文本图像。