论文

人格地图:在权重空间绘制语言模型人格特质

Persona Cartography: Charting Language Model Personality Traits in Weight Space

模型训练模型编辑与遗忘

摘要

大语言模型呈现反复出现的行为模式——人格(personas)——塑造泛化与安全,但我们缺乏分解、度量与控制它们的可靠工具。核心洞见是把人格当作行为特质空间中的位置:用OCEAN框架以开放性、尽责性、外向性、宜人性与神经质描述模型人格。我们训练低秩适配器放大或抑制个别特质,并用经人类验证面板校准的LLM裁判、特质专属选择题基准与标准能力评估评估其效果。跨三个家族的六个模型(4B–32B):每个适配器随规模大体单调地移动其目标特质,与其他适配器近似加性组合以构造混合人格,并在适度规模下保持能力基准表现。我们进一步显示诱导的特质轴影响下游评估中的安全相关行为:例如沿神经质与宜人性轴移动分别影响挫败感与谄媚。我们还引入无监督心理测量管线——从模型rollout恢复四个可解读的行为因子(语气、主动性、说教性、认知谨慎)。人格控制由此可以在权重空间中学习、缩放与组合特质——为人格测量、模型编辑与安全架桥。

人格地图:在权重空间绘制语言模型人格特质:论文配图
(a) 开放性提示的开放性判断得分 (b) 神经质提示的神经质判断得分 (c) 每个 OCEAN 评分者 + 对照的 LoRA 交互残差 图 4:LoRA 组合行为。 (a, b) LLM 判断通过在 {−2,−1,0,+1,+2}\{-2,-1,0,+1,+2\} 范围内组合 O↑ 和 N↑ LoRA 生成的模型的开放性和神经质分数热图。目标特征沿着其自己的适配器轴发生变化,而其他适配器则有适度的相关驱动贡献。 (c) LoRA 交互残差(在附录 F 中定义)对于 OCEAN 特征对来说几乎是相加的,其中责任心评分者是唯一的异常值。实线:4545 个 OCEAN↑↓×\timesOCEAN↑↓ 适配器对 (i,j)(i,j) 的残差,每个 OCEAN 记分器 k∈{k\in\{O,C,E,A,N}\} 一条曲线。黑色虚线(控制)用作非可加性本底噪声。