论文

语言模型中连续混合崩溃的动力学

The Dynamics of Continuous Mixture Collapse in Language Models

模型评测模型行为与机制分析

摘要

LLM 潜在状态推理方法用连续状态替换离散的中间标记,例如标记嵌入的加权混合,以保留多个可能的推理方向而不是致力于一个。然而,预训练的语言模型通常无法保留这些混合物。我们通过理论分析和对各种模型的受控实证研究相结合来研究原因。我们确定了三个独立的、不同的失败来源。首先,Transformer 架构已经扭曲了混合几何形状,并且训练大大放大了这种效果。此外,即使模型完美线性地传输混合物,也可能会发生故障:softmax 读数和自回归反馈形成一个动态系统,该系统要么放大微小差异,直到混合物的一种成分占主导地位,要么收缩不同的混合物,直到它们变得无法区分。我们根据经验验证了这一理论预测:观察到的收缩和放大之间的转变发生在我们分析得出的理论阈值附近,并且预训练模型的采样轨迹主要位于放大侧。最后,我们推广到许多组件的混合,并表明精确保存通常需要上下文相关的校正,其所需的维数可以随着组件数量的增加而增长。