论文
绘制和测量 大语言模型 的行为进化
Mapping and Measuring the Behavioral Evolution of Large Language Models
摘要
基准排行榜总结了语言模型的表现如何,但没有总结其行为与其他模型的行为或跨代变化的关系。我们使用来自 6 个系列的 32 个模型对包含 10{,}000 个提示的共享库的响应来描述其输出行为。嵌入每个响应后,我们构建了三个互补的句子级差异:对齐的平均每个提示距离,这是观察到的模型响应的伪度量;及时分歧的 PCA 压缩摘要;以及模型内部响应几何形状之间的无对齐 Gromov-Wasserstein 差异。我们使用这些结构通过行为地图、家族漂移、层次聚类、跨家族收敛和响应云分散来研究发布日期轴上的静态组织和时间变化。在这三种结构中,模型族形成了连贯的簇,其中 \texttt{gpt-2} 作为全局异常值;跨家庭的距离随着时间的推移而缩短;最近的一些面向推理的模型具有相对紧凑的响应云。基于每个提示最大平均差异的 词元级 交叉检查与句子级平均距离 (Spearman $ρ=0.98$) 非常一致,并恢复了相同的定性发现。我们通过测度理论的视角组织这些比较,使它们的对齐和不变性假设变得明确。我们还建立了一个与架构无关的充分条件,将行为相似性与推理提示覆盖率、小超额群体对数损失和类似的有效目标分布联系起来——一个可能的训练端帐户,而不是对观察到的趋势的经验解释。我们的管道是无标签的,并使用另外三个编码器重新编码每个响应(小至 73 倍),保留了排名几何、异常值和时间趋势的符号。