论文
模型表达、抑制和抵抗什么:使用角色向量审计开放权重 LLM
What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors
摘要
语言模型会做什么和不会做什么很大程度上是在 后训练 期间设定的,但它表达、隐藏或抵制哪些行为并不能仅通过提示来揭示。角色向量,即激活空间中的行为方向,可以探测这个组织,但之前的工作只涵盖了少数特征。我们首次在这种规模上系统地应用角色向量,编制了跨越四个行为不同领域的 53 个特征清单,并将两个开放权重模型中的每个特征标记为自然(在基线上表达)、可操纵的潜在但可放大或难以处理(难以标准提取)。两种模型都默认为有帮助的、以任务为导向的行为:所有九种代理特征都是自然的,它们的默认临床医生行为符合委员会认证的心理学家对 17 种特征中的 16 种的独立合意性判断。指导在这些默认设置所排除的特征上产生了最大的收益:夸张、幻觉和阿谀奉承。同样的不对称性存在于所有 171 个通用特征对中:两个可操纵的特征可以使组合崩溃,但涉及默认特征的对永远不会。当标准提取在诸如“邪恶”之类的特征上失败时,从微调变体转移的向量仍然可以恢复它,并且残留的拒绝出现在模型的思维链中。角色向量的信息量最大的不是作为一组控制,而是作为行为组织的探索。