论文
StyleText:风格化场景文本修复的大规模数据集和基准
StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting
摘要
我们提出了 StyleText,这是一个大规模数据集和基准,用于具有风格保留的本地化场景文本修复。 StyleText 包含 28,518 个图像遮罩提示三元组,分为 9,932 个场景系列,从而能够在共享场景上下文下对文本易读性和视觉一致性进行受控评估。我们使用自动化管道构建数据集,该管道结合了 LLM 提示模板、基于 Flux 的源生成与键值 (KV) 缓存注入、基于 OCR 的语义过滤、多边形掩模提取和掩模调节的 FluxFill 增强。我们使用归一化 OCR 指标(单词准确性和字符错误率)和 CLIP 图像-图像相似性以及显式预处理来定义可重复的评估协议。在 StyleText 上训练的 FluxFill+LoRA 基线比初始化显着提高了 OCR 准确性,同时保持了场景风格的一致性,为未来的比较建立了强有力的参考点。