论文
微调 改进语言模型中的信息传递
Fine-Tuning Improves Information Conveyance in Language Models
摘要
微调 通常被认为可以减少 大语言模型 的不确定性和多样性,但现有的分析忽略了输出长度(一个关键的混杂因素),因此无法捕获不确定性在整个代轨迹采样中的分布情况。为了解决这个问题,我们提出了 Canopy Entropy ($\mathrm{CE}^\star$),一种从树的角度看待语言生成的度量,其中“canopy”代表所有可能轨迹采样的空间,使得 $\mathrm{CE}^\star$ 自然地量化生成空间的有效大小。 $\mathrm{CE}^\star$ 共同捕获了输出长度 $N$ 和生成序列 $Y_{1:N}$ 中的不确定性——事实上,我们表明它等于总香农熵 $H(N, Y_{1:N}\mid X)$,其中 $X$ 表示提示。该公式产生可解释的指标,包括长度熵相关项 $ρ(N, r_N)$,其中 $r_N$ 是熵率,通过指示较长的输出每个标记的信息量是更多还是更少来量化信息传递效率。根据经验,在任务和模型系列中,我们发现微调模型始终表现出更强的正相关性 $ρ(N, r_N)$,即使总熵下降也是如此。此外,在控制模型族、任务、提示和输出长度效应后,我们发现 微调 几乎使熵率和语义多样性之间的相关强度增加了三倍,这表明对齐模型更有效地将标记不确定性转化为语义多样性。总的来说,这些结果表明 微调 不仅减少了不确定性,而且从根本上将其重新组织成信息更丰富、语义更有意义的世代。我们的代码可在 https://github.com/WeiyiTian/canopy-entropy 获取。