论文
GlyphAnchor:通过位置锚定字形先验增强视觉文本渲染
GlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph Priors
摘要
对于图像生成和编辑模型来说,渲染准确的文本仍然很困难,特别是当目标包含长、复杂且排列密集的文本或罕见字符时。现有的方法要么通过更强大的主干和以数据为中心的训练来改进本机文本渲染,而无需明确的字形先验,要么通过专门的设计合并字形先验,但在具有挑战性的场景下仍然不够准确和稳健。我们引入了 GlyphAnchor,这是一种新颖的文本渲染增强方法,适用于文本到图像和图像编辑扩散 Transformer 模型。 GlyphAnchor 使用轻量级字形补丁条件增强主干,其位置通过模型的本机位置编码锚定到目标图像。我们通过分阶段监督微调来训练这种能力,并通过文本感知 后训练 进一步完善它,以提高鲁棒性。我们还引入了 InfoTextBench,这是一个用于评估生成和编辑设置中丰富文本的视觉文本渲染的基准。跨多个主干和基准的实验,包括长、复杂、密集排列的文本和稀有字符场景,表明 GlyphAnchor 持续提高文本保真度,同时保持整体图像质量。