论文

语言模型的迭代自馈探针测量什么,以及将构造与模型分开的测试

What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model

模型评测评测方法与指标

摘要

越来越多的方法通过向语言模型提供自己的输出来探测语言模型:自洽、迭代细化、代理循环。我们问这样一个探针测量什么,在一个选择的结构中使问题变得尖锐:由模型自己的窗口条件 p_r(x_i | x_{i+-r}) 重新采样的词元单元环。其基础是词元序列上的格劳伯动力学,这并不新鲜;我们改变的是耦合。在常见随机数下推进两个在一个标记上不同的环,使得未损坏的副本的偏差恰好为零,因此在最大耦合给出混合时间的情况下,损坏扩散变得可测量。答案是它同时测量两种不同的东西,读数看起来很相似。一些量是由结构固定的:损伤光锥是运动学的,词元空间 Lyapunov 指数 lambda_ca(r) 的半径缩放在 19 个模型和跨越 70x 的两个比例梯中是模型不变的。其他人真正跟踪模型:lambda_ca 在训练中的可重复点处过零,并且吸引子份额始终对模型进行排名,无论晶格是如何构建的。如果不加区分,第一种很容易被误认为第二种——我们自己这样做了四个月,并报告了我们测量到的小数点后三位的相变,该相变属于探针而不是任何语言模型。我们给出了将它们分开的测试:保持结构固定并改变模型,或者保持模型固定并改变结构,然后查看哪些读数发生变化。我们首先通过再现来验证仪器,恢复 Domany-Kinzel 损伤场,与独立预测完全相反,然后我们报告了该学科发现的估计器故障——四个撤回的判决,每个判决都看起来像一个测量值。该方法作为一个包提供。