论文
通过 LLM 预训练追踪角色向量
Tracing Persona Vectors Through LLM Pretraining
摘要
大语言模型 如何在内部表示高级行为是与人工智能安全直接相关的核心可解释性问题:它决定了我们可以检测、审计或干预的内容。最近的研究表明,邪恶或阿谀奉承等特征对应于内部激活的线性方向,即所谓的角色向量。尽管这些向量现在通常用于检查和引导安全相关环境中的模型行为,但这些表示在训练过程中是如何形成的仍然未知。为了解决这一差距,我们在 OLMo-3-7B 的预训练过程中追踪角色向量,发现角色向量形成得非常早(在 OLMo-3 预训练的 0.22% 之内),并且对于引导完全训练后的指令模型仍然有效。尽管核心表示是很早就形成的,但角色向量在整个预训练过程中不断在几何和语义上进行细化。我们进一步比较了替代的启发策略,发现所有策略都产生了有效的方向,每种策略都呈现出潜在人物角色的定性不同的方面。重复我们对 Apertus-8B 的分析表明,我们的研究结果在质量上超越了 OLMo-3。我们的结果将角色表征确立为早期预训练的稳定特征,并为研究训练如何形成、完善和塑造它们开辟了道路。