论文

大语言模型从强化学习中学到什么?固定 SAE 轨道的机械可解释性视角

What Does an LLM Learn from Reinforcement Learning? A Mechanistic Interpretability Perspective with Fixed-SAE Track

模型评测模型行为与机制分析

摘要

强化学习 (RL) 被广泛应用于大型语言模型训练中,以提高目标能力,但 RL 如何重塑模型仍然知之甚少。之前解释强化学习如何工作的尝试在很大程度上提供了行为视角,但强化学习在表征层面为模型提供了什么仍是一个悬而未决的问题:强化学习能否创造出真正新颖的特征,以及它增强或抑制了哪些现有特征?机械可解释性的最新发展表明稀疏自动编码器(SAE)作为将内部激活分解为人类可解释特征的有前景的透镜;然而,它们不能直接应用于跟踪训练中的变化。在这项工作中,我们引入了Fixed-SAE Track,这是一个框架,它在跨基础模型和所有 RL 检查点汇集的激活上为每个考虑层训练一个共享 SAE,保持每个特征方向固定,以便通过可解释的 SAE 潜在特征的激活来严格定义表示转移,包括检测新兴的新特征。通过多个数据集和强化学习算法的验证,我们发现强化学习引起的漂移很小、渐进、特定于概念,并且集中在后期层,主要是提高一小部分梯子标记的采样率,格式化脚手架,例如步骤中断和答案分隔符,而不是重塑问题内容。将这些特征引入到基础模型中可以恢复大约 80% 的 RL 性能增益,这表明 RL 主要引出模型已经拥有的功能,就像转向一样。我们进一步设计了一个具有已知特征的综合基准,以测试 RL 是否能够注入真正新颖的特征。我们相信,Fixed-SAE Track 提供了一种跟踪表征变化的原则性方法,并为理解强化学习如何改变大语言模型的内部表征提供了表征证据。