论文

QUIET:LLM 创意生成能力的多空白级联故事完形填空基准

QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability

模型评测基准与评测资源

摘要

大语言模型(LLM)在创意能力评估方面面临双重挑战:现有基准(例如Story Cloze Test、HellaSwag)使用多项选择识别范式来衡量模型对叙事延续的辨别能力,而不是直接衡量创意生成能力;基于评分标准的评分和LLM-as-Judge方法依赖于主观维度评估或自然语言模型输出,无法提供客观、自动化的评分机制。本文提出了 QUIET(通过联锁评估测试的质量理解),这是一种基于多空白级联故事完形填空的 LLM 创造力的诊断基准。 QUIET在一个结构完整的故事中设置了N个空白(10-20),每个空白都伴随着明确的内容约束,并且空白之间存在级联依赖关系——前面的空白填充的内容限制了后面的空白的可行解空间。评估的模型(或人类参与者)填补了开放式生成模式的所有空白;结果通过信息论自动评分协议进行评分,无需人工评分。评分协议直接操作了“校准惊喜”理论框架(Zou & Xu,2026a)。对于每个空白 k,计算综合分数:分数 = 满足 * (1 + lambda * 惊喜),其中 lambda = 1.0。这里,“满足”衡量填空对内容约束(客观逻辑推理判断,而非主观审美打分)的满足程度,“惊讶”衡量在满足约束的情况下的惊讶程度。不满足约束条件的创意答案得分为零;满足约束条件但得分较低的答案;满足约束条件并且得分高得令人惊讶的答案。