论文

向谁校准? JEV 中的角色和语言对文化价值观的影响

Calibrated to Whom? Persona and Language Effects on Cultural Values in JEV

模型评测鲁棒性、公平性与可信度评测

摘要

仅决策语言模型返回每个答案选项的概率,而不是生成文本,这使得它们作为调查受访者和评审具有吸引力。我们使用 2013 年价值观调查模块审核了其中一个模型(TypeSafe 的 JEV)的文化价值观。我们按照 8 种提出请求的方式(288,000 个答案),以英语和阿拉伯语询问了 24 个项目,其中 12 个匹配的沙特角色、12 个匹配的美国角色以及没有角色。 JEV 的答案具有高度可重复性(ICC 0.997),并且在没有角色的情况下,它们与自己的美国角色相似。当角色是沙特而不是美国人时,答案就朝着沙特与美国的人类差异方向发展,用英语再现了 87% 的大小,用阿拉伯语再现了 62%,长期方向相反。语言交叉显示阿拉伯语中较小的差异来自项目的语言,而不是人物描述的语言。年龄对个人资料的影响与国籍一样大,性别对沙特人的影响比对美国人的影响更大,而且 JEV 对阿拉伯语和沙特人的信心较低。尽管模型从不生成文本,但每个请求设计中都保留了这些模式。