论文

UltraText Bench:评测图像生成中的中英密集文字

UltraText Bench: A Comprehensive Bilingual Benchmark for Evaluating Visual Text Rendering in Image Generation

模型评测应用与实践基准与评测资源评测方法与指标内容创作

摘要

密集的视觉文本需要图像生成器以正确的位置和易读性跨多个区域再现长字符串。随着短字符串渲染的改进,评估必须测试在更苛刻的场景中的持续性能。我们推出了 UltraText Bench,这是一种用于仅提示生成密集视觉文本的双语基准。它包含 432 个提示,涵盖 24 个现实世界场景类别和三个难度级别,中英文均等。每个经过人工审核的提示都为四到十二个文本区域提供精确的字符串,并与其内容、位置和视觉属性的结构化参考配对。我们使用 Q-Judger 视觉语言模型根据完整参考评估每个图像,报告文本保真度、文本清晰度、空间质量和场景质量。在 24 种模型配置中,这些尺寸显示出不同的优势:Z-Image-Turbo 比 Z-Image-Base 清晰度提高了 3.81 点,同时在报告的设置下失去了 14.76 点保真度。性能还随工作负载而变化; Qwen-Image-2512 的英语复合材料掉落 从 L1 的 86.50 到 L3 的 42.86。十名参与者参与了自动评分的人工评估。存储库:https://github.com/LINs-lab/UltraText_Bench。

UltraText Bench:评测图像生成中的中英密集文字:论文原图
图 2:局部成功可以隐藏整个场景的失败。这个说明性的六区域场景将正确的商店名称与其他地方的错误进行了对比。左边。正确呈现的商店名称,已裁剪。中心。完整场景,标记了五个进一步要求的区域。每一个都缺失、错误、无法读取、错位或清晰可辨,但与预期的表面结合不良。正确的。密集的文本负载和全场景评估覆盖了请求的文本。