论文
DataEvolver:用于生成富文本图像的自进化多代理数据构建
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
摘要
富含文本的图像生成是图像生成中最具挑战性的设置之一,因为模型必须同时生成视觉逼真的图像并渲染清晰、语义对齐且布局一致的文本。现有的数据管道通常遵循静态抓取-过滤-冻结范例。他们收集候选样本,过滤一次,然后冻结接受的数据进行训练。然而,被拒绝的样本通常会被丢弃,尽管它们通常包含有用的失败信号,例如 OCR 错误和语义不匹配。因此,以后的施工轮次可能会重复相同的故障模式。为了解决这些限制,我们提出了 DataEvolver,这是一种用于构建富含文本的图像数据的自我进化多智能体框架。 DataEvolver 将数据构建视为反馈驱动的构建策略演化。 检索器 收集候选样本,验证者分配质量分数和拒绝原因,评审Agent将回合级反馈总结为语义反馈,生成器通过有针对性的合成来完成未覆盖的区域。更新后的反馈记忆然后指导下一轮构建。对富含文本的图像生成基准的实验表明,在匹配的数据预算下,DataEvolver 比固定数据集基线生成更有用的训练数据。在 PixArt-alpha 上的 0.75M 规模上,DataEvolver 在 TextScenesHQ 上将 OCR-F1 比最强基线提高了 85.3%,在 LongTextBench 上提高了 35.3%。这些改进在两个评估基准中都是一致的,并且也转移到了 Show-o2,这表明 DataEvolver 的好处并不依赖于单个下游生成器。这些结果表明,被拒绝的样本可以为改进富含文本的图像数据构建提供可操作的反馈。