论文

从情境转变到风格崩溃:为什么训练目标比规模更重要

From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale

模型评测模型行为与机制分析

摘要

在现代 LLM 中,语言特征的功能不是作为文体工件,而是作为概率质量的探针,在训练对齐目标下分配。使用当代管道训练的语言模型表现出对语言特征的严重重塑,导致极端的语言重新分配。虽然之前的文体分析探讨了人工智能生成的文本和人类文本之间的语言差异,但我们重点关注困扰 LLM 训练管道本身的重塑。我们分析了 24 个语言驱动的探针中的 17 个模型(410M-100B+ 参数),记录了指令调整系统沿着话语和结构维度系统地崩溃语言熵(平均放大:1,949-16,853%,峰值:5,181-209,675%),同时选择性地将复杂标点符号抑制到基线频率的 3.2-23.2%。这些影响在 RLHF 下不会恶化,因为在匹配的基础模型对和指令调整模型对之间,差异模式在统计上无法区分 (p > 0.25)。弱干预 (lambda=1.0) 使崩溃加剧 240%,而强控制 (lambda=5.0) 实现了 40.5% 的改进,尽管规模劣势为 200-1000 倍,但优于前沿模型 96.7-98.2%。此外,与适度正则化相比,lambda=5.0 的distinct-4 提高了 15%,词汇多样性提高了 27%,重复率降低了 78%,建立对齐需要足够的控制强度,而不仅仅是分布平滑。我们的研究结果强调了现代 LLM 如何重新分配风格概率质量,尽管 RLHF 和规模。更广泛地说,我们的工作揭示了当前对齐管道的结构限制:偏好优化重塑了标准质量指标不可见但可通过分布探针检测到的语言分布,这对人工智能检测、训练数据污染和长期语言进化具有影响。