论文

递归语言的脆弱性谱-模型训练

A Fragility Spectrum for Recursive Language-Model Training

模型评测鲁棒性、公平性与可信度评测

摘要

模型生成的文本正在重新回到训练语料库中,并且有大量证据表明,对此类数据的训练一遍又一遍地破坏了输出的多样性。之前的工作研究了这种现象本身:哪些协议和哪些数据混合导致崩溃。但不同模型在同一流程下的表现却截然不同。我们修复了一个递归污染协议,并让 13 个公开发布的检查点形成一个生态系统,在五代中共享一个共同的语料库。五代后独特的 4 克结果在各个检查点范围从 0.187 到 0.940,大约是五倍的分布:一些模型几乎没有被触及,另一些则退化为重复的片段。更改共享池的组成或在人类文本中进行混合可以使排序的 Spearman 相关性保持在 0.91--0.97,而改变随机种子则可以使其保持在 0.93--0.98。那么,模型在递归训练下是否容易崩溃是检查点本身的一个属性,而且基本上没有经过检验。参数尺度本身并不能解释这一点,因为一个系列中的三尺寸梯子的尺寸不是单调的,而且我们测试的静态指标也没有预测这一点。有效的方法成本低廉:让一个模型迭代自己的输出两到三代,仅凭这一点就可以推断出它在更大生态系统中的脆弱性。崩溃速度也会对干预做出反应。收紧 top-p 可以在生成时切断低概率尾部,在三代内几乎停止崩溃,并稳定跨越整个频谱的六个检查点,而数据侧过滤可以减缓崩溃而不阻止它。