论文
忠实、丰富、精确:T2I 模型自然科学插图生成的基准测试
Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models
摘要
科学插图是传达研究成果的重要工具,尤其是在自然科学领域,它们将复杂的概念和过程可视化。随着文本到图像(T2I)模型的能力越来越强,研究人员已经开始使用它们来生成科学插图。然而,现有的基准通常在整体层面上评估输出,忽略了细粒度的元素,而科学推理能力和输出的简洁性仍然没有得到充分量化。我们推出 FEPBench,这是一个由跨多个学科和布局类型精心挑选的高质量科学插图构建的基准。在多模态 大语言模型 (MLLM) 和人类专家的帮助下,我们提供细粒度原子集注释,并从三个维度系统地评估 T2I 模型:指令 忠实性、推理丰富和语义精度。我们的评估进一步分解了视觉、文本、关系和布局元素的模型性能。结果表明,即使是最先进的 (SOTA) 闭源模型,例如 GPT Image 2 和 Nano Banana Pro,仍然面临文本渲染瓶颈、有限的推理丰富性以及难以平衡生成丰富度和精度。这些发现为在科学插图生成中改进和部署 T2I 模型提供了实用指导。基准数据、原子集注释和评估代码将由我们发布。