论文

LLM 如何看待创造力:通过可解释推理对视觉创造力进行零样本评分

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

模型评测模型行为与机制分析

摘要

评估视觉图像的原创性对创造力评估提出了持久的挑战。使用人工智能模型的自动评分已被证明在语言领域是有效的,但关键问题仍然是评估视觉创造力和理解模型如何得出评分。目前的研究询问多模态 大语言模型 (LLM) 是否可以作为视觉创造力零样本的评判者(没有任何 微调 或人类评分的例子),以及他们的“推理”输出是否为他们的评估过程提供了一个可解释的窗口。我们在 992 张 AI 生成的图像(基于人工编写的提示)和 1,500 张手绘草图上测试了 6 个多模态 LLM(Gemini 3 Flash、Gemma 4 31B IT、GPT-5.4 Mini、GLM-5v Turbo、Kimi K2.5 和 Qwen 3.6 Plus),并由人类评分者对创造力进行评分。在研究 1 中,所有模型在两个数据集上都显示出与人类创造力评级的基本一致(人工智能生成的图像上的 r = 0.57-0.68;草图上的 r = 0.29-68)。在研究2中,我们分析了三个LLM评估相同图像和图画的逐步推理过程。尽管推理使模型评估变得可解释——显示它们关注的内容、它们如何平衡原创性与质量以及它们如何证明其评级的合理性——推理并没有提高与人类评级的一致性。总之,我们的研究结果表明,多模态 LLM 可以在无需任何额外训练的情况下匹配人类对视觉创造力的判断,并且它们的推理揭示了人工智能模型如何评估创造力。实现此管道的开放评分应用程序可在 https://review-visual-eval-scoring.hf.space 上找到。