论文
大语言模型心理辅导
Psychological Steering of Large Language Models
摘要
大语言模型 (LLM) 模拟一致的类人行为,可以通过激活级别干预来塑造。这种范式与附加残余流注入相一致,它依靠注入强度扫描来近似最佳干预设置。然而,现有方法限制了未校准激活空间单元中的搜索空间和扫描,可能会错过最佳干预条件。因此,我们引入了一个心理指导框架,该框架以语义校准的单位执行无限制的、流畅性约束的扫描。我们的方法使用心理伪影导出和校准残余流注入,并且我们使用测量 OCEAN 个性模型的 IPIP-NEO-120 来比较六种注入方法。我们发现,在 14 个 LLM 中的 11 个开放式生成中,均值差 (MD) 注入优于个性提示 (P$^2$)(海洋转向的既定基线),增益为 3.6\% 到 16.4\%,推翻了之前支持提示的报告,并将表示工程定位为开放式心理转向的新前沿。此外,我们发现 P$^2$ 和 MD 注射的混合在 14 个 LLM 中的 13 个中优于这两种方法,比 P$^2$ 的增益范围为 5.6\% 到 21.9\%,比 MD 注射的增益范围为 3.3\% 到 26.7\%。最后,我们证明 MD 注入符合线性表示假设,并为心理转向提供可靠的、近似线性的控制旋钮。然而,它们也引发了背离“两大模型”的海洋特征协方差模式,这表明学习表征与人类心理之间存在差距。