论文

多语言文本到图像生成中跨语言一致性的局限性

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

模型评测基准与评测资源

摘要

近年来,文本到图像(T2I)生成取得了显着的进展。然而,现有的研究主要集中在纯英语环境上,而没有充分探讨跨语言的表现差距和特定语言的影响。为了填补这一空白,我们推出了 LingT2I,这是一个涵盖 10 种广泛使用的语言和 33K 提示的基准测试,旨在评估内容生成和文本渲染方面的跨语言效果。在此基准的基础上,我们进行了全面的跨语言分析,揭示了评估维度上的语言不平等和语言相关的权衡。除了定量评估之外,我们还进一步揭示了一系列依赖于语言的生成模式,强调语言因素及其相应的文化背景如何系统地影响模型输出。我们的基准测试和分析为研究 T2I 生成中的跨语言行为提供了基础,并促进了更强大和更具包容性的模型的开发。代码和数据集可在 https://github.com/RISys-Lab/LingT2I 获取。