论文

大语言模型 的连续 后训练 中的表示崩溃

Representation Collapse in Sequential Post-Training of Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 现在通过 后训练 阶段链进行调整,而不是通过单个指令调整过程。本文研究了这种顺序 后训练 是否逐渐将内部表示压缩到低秩、各向异性和同质的特征空间中。我们为隐藏状态、logits、词元轨迹和 LoRA 更新定义了一个测量套件,并用它来分析受监督的 微调、偏好优化、安全/拒绝调整、数学和代码专业化以及受控阶段排序下的长链思想调整。中心假设是,过度的表示集中不仅仅是一种几何好奇心:它预测了后期适应过程中可塑性的降低、域外泛化能力的减弱以及校准能力的较差。我们进一步评估轻量级干预措施,包括混合域重放、特征刷新、表示多样性正则化和 LoRA 更新去相关性,作为在不放弃 后训练 行为收益的情况下保留未来可学习性的方法。