论文

博弈中的人格向量:通过激活向量测量与引导策略

Persona Vectors in Games: Measuring and Steering Strategies via Activation Vectors

模型评测模型行为与机制分析

摘要

大语言模型(LLM)正日益被部署为策略环境中的自主决策者,但我们理解其高层次行为特质的工具仍然有限。我们在博弈论环境中使用激活引导方法,通过对比激活加法(contrastive activation addition)构建了利他性、宽恕性与对他人预期的人格向量(persona vectors)。在经典博弈上的评估表明,激活引导会系统性地改变定量策略选择与自然语言辩护。然而我们也观察到,在引导之下,言辞与策略可能出现背离。此外,关于自身行为的向量与关于他人预期的向量是部分不同的。我们的结果表明,人格向量为策略环境中的高层次特质提供了一个有前景的机制性抓手。

博弈中的人格向量:通过激活向量测量与引导策略:论文配图
图2:左图GPT-4.1-mini按前缀效价与游戏分组评出的利他评分,右图为对应利他向量平均投影。