论文

LLM的机制性人格分析:经潜在特征干预转向人格

Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions

模型推理解码与生成控制

摘要

大语言模型(LLM)已展示在生成文本中仿真类人OCEAN人格特质的能力。先前努力聚焦提示工程或微调以塑造LLM人格。本工作中——我们提出直接干预模型潜在特征的机制可解释性方法。我们的方法使用稀疏自编码器(SAE)与对比激活分析——识别残差流中对应目标OCEAN特质的潜在方向。我们在激活空间形式化加性转向向量——并展示对隐藏态施加小加性偏移如何在保持整体语言建模性能的同时增强目标特质。为确定特征偏移的最优组合——我们探索带网格搜索优化的线性加权启发式——平衡人格表达与任务性能。我们的方法在机制层面可控地转向人格特质——同时在标准基准上保持高性能——展现出前景。

LLM的机制性人格分析:经潜在特征干预转向人格:论文配图
图 1:我们的个性引导管道概述,显示了从数据生成到特征提取、优化和评估的流程。过程将数据转化为结果,而评估将结果转化为算法和结果分析的数据。网格搜索算法涉及两个基准测试,第三个是在网格搜索后执行的。网格搜索算法的每次迭代都涉及对操作的 LLM 引导参数的修改。