论文

引入背景温度以刻画大语言模型中的隐藏随机性

Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models

模型评测评测方法与指标

摘要

即使以温度 $T=0$ 解码,大语言模型(LLM)也可能对相同输入产生发散的输出。Thinking Machines Lab的近期工作强调了实现层面的非确定性来源,包括批次大小变化、核函数非不变性以及浮点非结合性。在这篇短文中,我们通过引入背景温度(background temperature)$T_{\mathrm{bg}}$ 的概念来形式化这一行为,即即使在名义 $T=0$ 时也能观察到的、由依赖实现的扰动过程所诱导的有效温度。我们给出了清晰的定义,说明 $T_{\mathrm{bg}}$ 如何与由推理环境 $I$ 支配的随机扰动相关联,并提出一个经验性协议,通过理想参考系统的等效温度 $T_n(I)$ 来估计 $T_{bg}$。最后,我们给出了在主流LLM提供商的代表性模型池上进行的一组试点实验,用以演示这一想法,并概述其对可复现性、评估与部署的影响。

引入背景温度以刻画大语言模型中的隐藏随机性:论文配图
图1:测量协议示意:通过引入背景温度来刻画大语言模型输出中隐藏的随机性,为后续分析提供度量框架。