论文
PersonaManifold:在LLM角色表示中揭示和利用弯曲几何形状
PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations
摘要
在推理时控制大语言模型 (LLM) 中的角色对于角色扮演、个性化对话和社交模拟非常重要。最近的方法从模型的激活空间中提取角色向量,并在线性表示假设下应用欧几里得运算(加法、缩放和线性插值)。然而,这些方法本身报告了系统性失败:非正交性状维度、不对称上限和阻力效应以及多性状组成的显着偏差,表明线性各向同性假设不成立。我们提出了 PersonaManifold,一个将角色表示建模为激活空间中弯曲的低维黎曼子流形上的点的框架。我们估计流形的内在几何形状——局部度量张量、测地距离和奥利维尔-里奇曲率——并引入测地线转向,它沿着流形测地线而不是欧几里得直线在角色之间进行插值。我们还提出了行为相似性三元组(BST)基准,它自动生成基于六种既定心理结构的情境问题,并通过行为反应而不是自我报告问卷来定义角色相似性。对三个开源 LLM 的实验表明,角色激活形成具有异质曲率的流形,测地距离比欧几里得替代方案更准确地预测行为相似性,且具有各向异性和曲率的独立贡献,并且测地转向在我们的 BST 基准和外部评估上产生更连贯的中间角色,优势集中在流形偏离平坦度最大的高偏差区域。