论文
UltraText Bench:评测图像生成中的中英密集文字
UltraText Bench: A Comprehensive Bilingual Benchmark for Evaluating Visual Text Rendering in Image Generation
摘要
密集的视觉文本需要图像生成器以正确的位置和易读性跨多个区域再现长字符串。随着短字符串渲染的改进,评估必须测试在更苛刻的场景中的持续性能。我们推出了 UltraText Bench,这是一种用于仅提示生成密集视觉文本的双语基准。它包含 432 个提示,涵盖 24 个现实世界场景类别和三个难度级别,中英文均等。每个经过人工审核的提示都为四到十二个文本区域提供精确的字符串,并与其内容、位置和视觉属性的结构化参考配对。我们使用 Q-Judger 视觉语言模型根据完整参考评估每个图像,报告文本保真度、文本清晰度、空间质量和场景质量。在 24 种模型配置中,这些尺寸显示出不同的优势:Z-Image-Turbo 比 Z-Image-Base 清晰度提高了 3.81 点,同时在报告的设置下失去了 14.76 点保真度。性能还随工作负载而变化; Qwen-Image-2512 的英语复合材料掉落 从 L1 的 86.50 到 L3 的 42.86。十名参与者参与了自动评分的人工评估。存储库:https://github.com/LINs-lab/UltraText_Bench。
