论文
TextAlign:具有分层奖励的文本渲染的偏好对齐
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
摘要
忠实的文本渲染仍然是大型文本到图像生成模型的一个持续弱点,因为它需要遵循语义指令和细粒度的字形级结构。先前的方法通常通过特定于架构的模块或编码器修改来提高这种能力,这使得跨基础模型的部署变得复杂。我们将文本渲染作为 后训练 偏好对齐问题进行研究,并提出 TextAlign,这是一种保持生成器架构不变的非侵入性框架。关键组件是基于分层视觉语言模型 (VLM) 的奖励,它将渲染错误分解为全局、单词和字形级别,然后将二进制缺陷判断转换为标量偏好信号。生成的信号支持组相对策略优化 (GRPO) 和直接偏好优化 (DPO)。 FLUX.1-dev 和 Z-Image-Turbo 上的实验表明,基于 OCR 的文本准确性得到了一致的提升,而不会降低总体生成质量。与强大的基础和文本渲染基线(包括 SD3.5、Qwen-Image、AnyText 和 TextDiffuser)相比,这些结果表明奖励设计为模型重新设计提供了一种可扩展的替代方案,以改善文本渲染。