论文

分解部首,然后奖励:精确中文文本渲染的细粒度检查

Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text Rendering

模型训练奖励建模与过程监督

摘要

对于文本到图像模型来说,渲染准确的中文文本仍然具有挑战性。现有的基于 OCR 的强化学习奖励将解码的文本与目标字符串进行比较。这种奖励忽视了中文书写的组成性质:表意文字由通过明确的空间关系排列的可重复使用的组件组成,但 OCR 将其评估为原子字符。因此,视觉上不同的激进级错误可能会收到同样粗略的反馈,鼓励仅仅类似于目标而不是忠实地再现其内部结构的字形。我们采用表意描述序列 (IDS),其中包含空间运算符和字符组件,并训练专家 IDS 识别器将渲染的中文文本转录为这种表示形式。在此识别器的基础上,我们引入了 IDSpect,它确定性地将目标文本分解为 IDS 标记,并将裁剪区域级别的视觉 IDS 预测与目标序列对齐。全局唯一的词元信用使得这种比较对于检测到的文本区域的顺序是稳健的。与整个字符语义奖励相结合,IDSpect 提供具有组件和空间关系的细粒度信用,而无需更改图像生成器或增加推理时间成本。 Qwen-Image GRPO 后训练实验表明,IDSpect 在 LongText 和 GenTextEval 上实现了领先的结构质量和语义对齐。