论文
T2LSC-Bench:文本到图像生成中的本地化语义控制基准测试
T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
摘要
最近的文本到图像模型越来越能够渲染显式文本,但可靠的本地化文本控制需要的不仅仅是生成正确的字符串。在产品标签、标牌和界面设计等应用中,目标文本应在指定的文本承载区域内呈现,而不改变预定义的主题身份或周围场景语义。我们将违反此要求的行为称为目标文本相关语义泄漏,其中目标文本语义通过指定锚点之外的非文本视觉内容来表达。现有的视觉文本基准主要评估可读性、拼写准确性和布局,而这种形式的语义泄漏在很大程度上未经检查。我们引入了 T2LSC-Bench,这是一种受控诊断基准,每个模型包含 50 个种子受试者和 1,200 个提示案例,在六个模型中生成 7,160 个评估图像。其因子化设计改变了语义关系、场景开放性、提示方式、语言。双分支协议将 OCR-VLM 文本验证与结构化 VLM 语义判断相结合,以测量锚点文本准确性 (TAA)、语义主题保留 (SSP)、语义泄漏率 (SLR) 和条件语义泄漏率 (cSLR)。在压力测试条件下,SLR从1.2%增加到18.1%,cSLR从1.3%增加到18.2%,而TAA仅从91.4%减少到90.9%。防泄漏提示可将 SLR 从 16.6% 降低至 8.4%,而不会降低渲染精度。对 420 个图像的人工验证显示自动注释和裁决注释之间存在很强的一致性。这些结果表明,准确的文本渲染并不能保证目标文本语义的本地包含。