论文
超越可复现性:Token概率揭示大语言模型的非确定性
Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism
摘要
已有研究表明,大语言模型(LLM)在图形处理器(GPU)上执行时会产生非确定性结果,即使将其配置为产生确定性结果也是如此。这是由于算术运算的有限精度效应,其结果取决于运算的执行顺序;而执行顺序又取决于GPU上并发运行的进程。以往研究要么聚焦于非确定性对LLM生成文本的影响,要么提出实现确定性执行的机制。本工作通过分析token概率(而非生成文本)的变化,更细致地考察非确定性。有趣的是,所有受评估模型在概率变化的趋势与实际数值上均得到相似结果。具体而言,结果表明非确定性对处于0.1到0.9区间的token概率影响显著,而当概率接近0或1时影响则小得多。这对我们理解非确定性具有重要意义。其一,当温度不为零时,非确定性很可能对生成文本产生不可忽视的影响,因为它会在token概率上引入显著变化,除非这些概率接近0或1。其二,这表明所有模型在token概率层面具有相似的非确定性变化;因此,生成文本表现出的不同性能波动——例如在基准上测量准确率时——似乎来自不同的token概率或响应长度。第三点含义是,我们或许可以通过运行单次推理并分析token级概率来估计非确定性的影响,而不必多次运行同一推理。
