论文
使用持久同源性跟踪 大语言模型 中的表示动态
Tracking Representation Dynamics in Large Language Models with Persistent Homology
摘要
大语言模型 通常通过受监督的 微调 进行对齐,但人们对其内部表示在此过程中如何演变知之甚少。我们通过跟踪整个 微调 激活空间的拓扑,使用持久同源性来研究对齐动力学。在从 1B 到 7B 参数的四种 Transformer 语言模型以及对应于有用、无害和混合训练数据的三个对齐目标中,我们发现大多数拓扑重组发生在训练的最早阶段。密集检查点分析揭示了拓扑活动的短暂峰值,随后迅速稳定。我们进一步表明,不同的对齐目标会产生可区分的拓扑轨迹,而指令调整和预训练的模型则表现出本质上不同的进化模式。我们的结果表明,持久同源性提供了对齐的补充视角,揭示了仅从行为指标中不明显的表征水平变化。