论文
温度前后:Creative LLM 一代的分布视图
Before and After Temperature: A Distributional View of Creative LLM Generation
摘要
大语言模型 (LLM) 创造力的无参考评估依赖于困惑度、熵和 top-1 裕度。我们表明,更强的信号在管道中提前一步存在:在绘制下一个标记之前采样温度 \emph{重塑} 模型的标记分布。在 Llama-3.1-8B-Instruct 上,$T \in \{0.3, 0.8, 1.5\}$ 上有 500 个开放式创意提示,从此重塑中派生的单个每个标记特征可预测 Spearman $ρ{=}0.918$ 的提示内创意排名,与平均 gpt-4o\,/\,gemini-2.5-pro 评判相比($n{=}500$) 和 $ρ{=}0.870$ 与三人多数人排名 ($n{=}150$) 相比。四个标准无参考基线(自困惑度、平均预测熵、top-1 边距、gzip 压缩比)中的每一个在两个基本事实上均达到 $|ρ|\!\approx\!0.76$ 的最高值:平均 LLM 上的差距为 $+0.165$ ,人类多数的差距为 $+0.110$ ,两者都远远大于基线本身之间的差距。两个 真值 面板在 $ρ{=}0.83$ 上彼此一致,高于 $ρ{=}0.77$ 的人际上限,因此比较不会受到判断噪声的瓶颈。从机制上讲,胜利来自于不相干制度的尖锐分布特征:在$T{=}1.5$处,累积质量宽度$n_{95}(q)$从$\sim\!1$膨胀到${\sim}\!131$词元,并且温度后质量从温度前最高$90\%$泄漏大约$13$个百分点。每个词元的聚合不会将 $T{=}0.8$ 与 $T{=}0.3$ 分开;区分两个相干机制留给序列级特征。