论文
人格地图:在权重空间绘制语言模型人格特质
Persona Cartography: Charting Language Model Personality Traits in Weight Space
摘要
大语言模型呈现反复出现的行为模式——人格(personas)——塑造泛化与安全,但我们缺乏分解、度量与控制它们的可靠工具。核心洞见是把人格当作行为特质空间中的位置:用OCEAN框架以开放性、尽责性、外向性、宜人性与神经质描述模型人格。我们训练低秩适配器放大或抑制个别特质,并用经人类验证面板校准的LLM裁判、特质专属选择题基准与标准能力评估评估其效果。跨三个家族的六个模型(4B–32B):每个适配器随规模大体单调地移动其目标特质,与其他适配器近似加性组合以构造混合人格,并在适度规模下保持能力基准表现。我们进一步显示诱导的特质轴影响下游评估中的安全相关行为:例如沿神经质与宜人性轴移动分别影响挫败感与谄媚。我们还引入无监督心理测量管线——从模型rollout恢复四个可解读的行为因子(语气、主动性、说教性、认知谨慎)。人格控制由此可以在权重空间中学习、缩放与组合特质——为人格测量、模型编辑与安全架桥。
