论文

解耦分析判断:在复杂的多步骤创造力任务中使用 LLM 的自动创造力评估器

Decoupled Analysis-Judging: An Automated Creativity Evaluator Using LLMs in Complex Multi-step Creativity Tasks

模型评测评测方法与指标

摘要

对于作为法官的 LLM 来说,创造力任务的自动评估仍然具有挑战性,因为 LLM 容易受到冗长偏见和宽大偏见​​等偏见的影响。这种局限性在上下文相关和程序结构化任务(CGPST)中尤其明显,这是一种复杂的多步骤创造力任务,其中步骤间依赖性、高度主观性和宽评分范围导致更加不稳定和有偏见的判断。现有的方法要么依赖于特定任务的训练,要么直接应用 LLM-as-a-Judge,这两种方法都难以确保在如此复杂的情况下进行可靠的评估。为了弥补这些差距,我们提出了 CreaEval,这是一种用于 CGPST 的自动化创造力评估器,它将典型的 LLM-as-a-Judge 解耦为分析和判断。相应地,CreaEval 涉及两个关键阶段: 记忆增强分析,SoT-LLM 将多步骤响应转换为结构化评估证据,并结合跨步骤记忆;基于证据的判断,法官-LLM 使用提取的证据进行判断,而无需访问原始答案。综合实验表明,CreaEval 在 CGPST 和两个经典的简单创造力任务中比第二好的基线平均性能提高了 22.74%,证明了其普适性。该代码可从 https://github.com/Jaong/CreaEval 获取。