论文

TextSculptor:场景文本编辑训练和基准测试

TextSculptor: Training and Benchmarking Scene Text Editing

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 和基于扩散的生成模型的最新进展极大地改进了提示驱动的图像编辑。然而,场景文本编辑仍然具有挑战性,因为它需要模型精确修改文本内容,同时保留视觉真实感和非目标区域。当前的开源模型仍然落后于专有系统,这很大程度上是由于缺乏高质量的训练数据以及缺乏针对文本编辑的标准化基准。为了应对这些挑战,我们推出了 TextSculptor,这是一个用于数据构建和场景文本编辑评估的综合框架。我们首先开发了一个自动化数据构建管道,它将文本感知图像合成与编程文本渲染和合成相结合。基于此管道,我们构建了 TextSculpt-Data,这是一个包含 320 万个训练样本的大型数据集,其中包括 120 万个经过 OCR 验证的文本到图像样本和 200 万个具有自然对齐的源目标图像和强背景一致性的配对文本编辑样本。我们进一步介绍了 TextSculpt-Bench,这是一个涵盖四个基本文本编辑任务的基准测试:文本添加、文本替换、文本删除和混合编辑。为了支持可靠的评估,我们设计了一个定制的协议,通过基于 OCR 的文本对齐、多模态判断和背景区域相似性来测量文本准确性、视觉质量和背景保留。大量实验表明,TextSculptor 提高了开源文本编辑性能并缩小了与专有模型的差距。数据和基准可在 https://github.com/linyiheng123/TextSculptor 获取。