论文
角色跟随不是选择性控制:LLM 用户模拟中的中立性差距
Persona Following Is Not Selective Control: The Neutrality Gap in LLM User Simulation
摘要
角色提示广泛用于使用大语言模型 (LLM) 构建用户模拟,但它依赖于一个很大程度上未经测试的假设:指定一个用户属性应该单独更改该属性。我们测试了这个假设,并发现了选择性控制的系统性失败:在我们审计的所有八个黑盒LLM中,改变目标属性也会改变对未指定的非目标属性的响应。例如,将用户描述为更具风险偏好会改变颜色选择,即使提示从未提及颜色;我们称之为跨属性影响。语义、上下文和内部分析共同表明,模型将角色提示视为有关用户的证据,并将推断的个人资料扩展到未指定的偏好,我们将这一过程称为特质条件完成。接下来我们询问显式指定非目标属性是否可以恢复选择性控制。当非目标属性被赋予明确的方向时,模型通常会遵循声明并抑制目标属性的影响。然而,当同一属性被声明为中性时,即使模型正确报告了声明的状态,目标也会继续影响所有五个开放权重检查点的选择。这种差异,即中立差距,表明成功的角色跟随并不意味着选择性的角色控制,这还需要保持非目标属性的稳定。我们通过三态诊断来操作这种区别,该诊断保留非目标属性未指定或声明其是定向的或中性的;因为只需遵循指定的角色就可以通过定向测试,所以中立状态会揭示他们错过的失败。在对独立项目的事后分析中,中立声明使 51-81% 的项目对目标敏感,而定向声明下的 320 个项目极点比较中最多有 1 个。