论文
LLM的机制性人格分析:经潜在特征干预转向人格
Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions
摘要
大语言模型(LLM)已展示在生成文本中仿真类人OCEAN人格特质的能力。先前努力聚焦提示工程或微调以塑造LLM人格。本工作中——我们提出直接干预模型潜在特征的机制可解释性方法。我们的方法使用稀疏自编码器(SAE)与对比激活分析——识别残差流中对应目标OCEAN特质的潜在方向。我们在激活空间形式化加性转向向量——并展示对隐藏态施加小加性偏移如何在保持整体语言建模性能的同时增强目标特质。为确定特征偏移的最优组合——我们探索带网格搜索优化的线性加权启发式——平衡人格表达与任务性能。我们的方法在机制层面可控地转向人格特质——同时在标准基准上保持高性能——展现出前景。
