论文
指导大语言模型对挪威 MFQ-30 道德基础的反应
Steering LLMs Responses Towards Moral Foundations on the Norwegian MFQ-30
摘要
最近的工作将人类心理测量问卷应用于大型语言模型,以得出道德和价值概况,但尚不清楚这些工具是否测量模型中稳定的东西,或者所得的概况是否可以转向目标人群。我们对六名开放权重大语言模型进行了挪威道德基础调查问卷 (MFQ-30),并将他们的基础概况与 N = 1,282 名挪威受访者样本进行比较。我们测试了两种引导干预措施:提示级角色引导和激活级 ActAdd。在我们的注意力检查下,一半的模特参与了问卷调查。另一半默认为平坦或集中趋势输出,平均看起来接近人类,而不跟踪项目内容。中立的北欧受访者角色,在没有来自人类样本的任何分布信息的情况下编写,使引人入胜的模型更接近 Mahalanobis $d^2$ 中的挪威平均值 44-77%。固定中间层处的一对 ActAdd 使基础轮廓变平,而不是引导各个基础。对于至少一个模型来说,改变形象的相同角色也会引起基线时不存在的参与,这是 Peereboom 等人的认知幻象的一个具体例子。 (2025) 警告。