论文

知识可视化:知识密集型文本到图像生成的基准和方法

Knowledge Visualization: A Benchmark and Method for Knowledge-Intensive Text-to-Image Generation

模型评测基准与评测资源

摘要

最近的文本到图像(T2I)模型在真实感合成和指令跟踪方面表现出了令人印象深刻的能力。然而,它们在知识密集型环境中的可靠性在很大程度上仍未得到探索。与自然图像生成不同,知识可视化不仅需要语义对齐,还需要严格遵守领域知识、结构约束和符号约定,暴露了视觉合理性和科学正确性之间的关键差距。为了系统地研究这个问题,我们引入了 KVBench,一个基于课程的基准,用于评估知识密集型 T2I 生成。 KVBench 涵盖高中六门学科:生物、化学、地理、历史、数学、物理。该基准由来自 30 多本权威教科书的 1,800 条专家精选提示组成。使用这个基准,我们评估了 14 个最先进的开源和闭源模型,揭示了逻辑推理、符号精度和多语言鲁棒性方面的重大缺陷,并且开源模型的表现始终低于专有系统。为了解决这些局限性,我们进一步提出了 KE-Check,这是一个两阶段框架,通过以下方式提高科学保真度:(1)用于结构化提示丰富的知识精化,以及(2)检查表引导细化,通过违规识别和约束引导编辑来实现显式约束执行。 KE-Check 有效缓解科学幻觉,缩小开源模型与领先闭源模型之间的性能差距。数据和代码可在 https://github.com/zhaoran66/KVBench 公开获取。