论文

采样更多却获得更少:概率校准是语言模型多样性的瓶颈

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

模型评测模型行为与机制分析

摘要

多样性对于从创意生成到科学发现的语言模型应用至关重要,但现代 LLM 经常会崩溃为看似合理的输出的狭窄子集。虽然之前的工作已经制定了衡量这种多样性缺乏的基准,但人们对推理时的逐步概率分布如何导致该问题知之甚少。我们引入了一个有效性-多样性框架,将多样性崩溃归因于 LLM 在解码过程中如何在有效和无效延续之间分配概率质量。该框架将瓶颈分解为两种互补的错误校准形式。首先,顺序校准:有效词元不能可靠地排在无效词元之上,因此基于排名的截止规则必须在恢复有效延续和接纳无效延续之间进行权衡。其次,形状校准:概率质量过度集中于少数有效延续,同时具有混合有效和无效词元的重尾,因此保持高有效性限制了多样性。我们将这两种机制形式化,并表明局部故障在解码步骤中复合,产生严重的序列级多样性损失。根据经验,我们开发了受控诊断来探测这些瓶颈,包括具有确切已知的有效集和预言机截止基线的任务。在跨越多个家族和尺度的 14 个语言模型中,我们发现多样性崩溃不仅仅是特定采样启发式的限制,而且是 LLM 分布中顺序和形状错误校准的结果。