论文

剩余解码器适配器:用于自回归文本渲染的 ID 保留标记器自适应

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

应用与实践内容创作

摘要

视觉自回归 (AR) 模型通过预测由视觉标记生成器解码的离散标记来生成图像。尽管表现出强大的整体图像生成能力,但它们在模糊笔画和破坏字母形状的文本渲染方面仍然表现不佳。在这项工作中,我们将这种限制追溯到视觉分词器,它很难重建细粒度的细节。改进分词器很简单,但成本很高,因为它需要重新训练分词器和 AR 模型。我们能否在不重新训练现有分词器和 AR 模型的情况下提高 AR 模型的文本渲染性能?为了实现这一目标,我们提出了残差解码器适配器(RDA),它可以在不改变其词元空间的情况下事后升级现有的词元生成器。具体来说,它通过引入两个新颖的组件来细化视觉分词器的解码器输出:(i)与原始码本共享词元分布的配对码本; (ii) 并行分支,用于学习像素空间中重建图像和 真值 图像之间的微小差异(残留)。这种残差设计使我们能够非侵入性地增强分词器,同时保持与之前的 AR 模型的兼容性。 RDA 大幅改善了文本渲染。例如,在竞争性 TextAtlas 基准测试中,我们将微调后的 Janus-Pro OCR 准确率从 24.52% 提高到 58.26% (TextVisionBlend),从 ​​12.75% 提高到 36.81% (StyledTextSynth)。代码可在 https://github.com/CSU-JPG/RDA 获取