论文

AIBench:评估学术插图生成中的视觉逻辑一致性

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

模型评测基准与评测资源

摘要

尽管图像生成通过其快速发展促进了各种应用,但最先进的模型是否能够为论文生成现成的学术插图仍然很大程度上尚未被探索。直接与VLM比较或评估插图是原生的,但需要oracle多模态理解能力,这对于长而复杂的文本和插图来说是不可靠的。为了解决这个问题,我们提出了 AIBench,这是第一个使用 VQA 评估学术插图逻辑正确性和 VLM 评估美学的基准。具体来说,我们根据论文方法部分总结的逻辑图设计了四个级别的问题,询问生成的插图在不同尺度上是否与论文相符。我们基于 VQA 的方法可以对视觉逻辑一致性进行更准确、更详细的评估,同时减少对判断者 VLM 能力的依赖。借助我们高质量的AIBench,我们进行了大量的实验,得出的结论是,模型在该任务上的性能差距明显大于一般模型,反映了它们各种复杂的推理和高密度生成能力。此外,逻辑和美学很难像手工制作的插图一样同时优化。其他实验进一步表明,这两种能力的测试时间扩展显着提高了该任务的性能。