论文
自我训练不会使语言扁平化,而是对其进行重组:表面标记增强,深层语法消亡
Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies
摘要
对语言模型自身输出的连续自我训练被广泛描述为扁平化过程:多样性下降,分布变窄,文本变得“更像它自己”。我们提供的证据表明这种描述是不完整的。在五个模型(GPT-2 124M、Pythia-410M、Pythia-1.4B、OPT-1.3B、Pythia-2.8B)上的十一代自我训练中,语言并不是统一扁平化的——而是进行了重组。表面标记(话语连接词、限制语、破折号)上升,而中层和深层句法结构(问题、插入语、被动语气、虚拟语气)崩溃。我们将这种不对称崩溃形式化为结构深度假说(SDH):语言特征的每代衰减率主要通过其结构深度(它需要的嵌套句法依赖的数量)来预测,其次是通过其零代输出频率来预测。汇集来自三个架构系列的五个模型 (N=85) 的 17 个特征面板,汇集的 Spearman 相关性为 rho=0.540 (p < 10^{-6}; cluster-bootstrap 95% CI [0.434, 0.634]),而频率是一个较弱的预测因子 (rho=0.225)。匹配的人类文本 微调 控制产生 rho=0.039 (p=0.88),确认梯度是自我训练特定的。我们进一步记录了一个表面复杂性悖论:随着底层子句结构的消亡,聚合复杂性代理(深度树深度、TTR、字长)都会上升,这对训练数据管理和 LLM 文本检测有直接影响。