论文
内在护栏:人格的语义几何如何与 LLM 中的紧急错位相互作用
Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
摘要
良性窄数据上的 微调 大语言模型 (LLM) 有时会引发广泛的有害行为,这种漏洞称为紧急错位 (EM)。虽然之前的工作将这些失败与激活空间中的特定方向联系起来,但它们与模型更广泛的角色的关系仍未得到探索。我们通过已建立的心理测量概况(如大五、黑暗三合会和 LLM 特定行为(例如邪恶、阿谀奉承))来映射 LLM 的潜在人格空间,并表明语义几何在对齐模型及其损坏的微调中高度稳定。通过因果干预,我们发现隔离社会效价的方向,例如“邪恶”角色向量和我们引入的语义效价向量(SVV),起到了内在护栏的作用:消除它们使错位率超过 40%,而放大它们则将故障模式抑制到低于 3%。利用个性空间的结构稳定性,我们证明向量从指令调整模型中提取 $\textit{apriori}$ 传输零样本,以成功地调节损坏的微调中的 EM。总的来说,我们的研究结果表明,有害的 微调 不会覆盖模型的内部人格表征,从而允许保守的表征充当强大的跨分布护栏。