论文

无需训练 通过字形先验和注意力引导语义混合进行遮挡文本渲染

Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending

应用与实践内容创作

摘要

我们提出了一个 无需训练 框架,用于使用预训练的 FLUX.1-dev 主干进行遮挡文本渲染。该任务需要一个模型来渲染可识别的版式并将遮挡对象放置在预期的文本区域上。对于现有的文本到图像生成器来说,此设置仍然很困难:遮挡物通常会偏离文本,而文本可能会扭曲或看起来漂浮在遮挡对象的顶部。为了解决这个问题,我们提出了一个重新启动的双流推理框架,它将文本布局保留与遮挡物插入分离。基本流提供干净的排版参考和相同步骤的键/值 (K/V) 功能,而编辑流则以遮挡提示为条件。我们进一步采用了 FreeText 中的频谱字形先验思想,并对其进行调整以在早中期去噪期间稳定目标文本结构。在推理过程中,我们的方法定位目标文本,根据标记条件注意力和字形支持估计文本带区域,并为遮挡器导出锚感知硬融合掩模。在最终的编辑过程中,生成从相同的初始噪声重新开始,并在选定的注意位置应用硬掩模引导的图像标记 K/V 替换,保留掩模外部的基本布局,同时从掩模内部的编辑流注入遮挡器外观。对代表性遮挡文本场景的实验表明,文本可读性和竞争性遮挡对齐得到了显着改善,无需任何模型 微调 即可产生更稳定的文本对象组合。